Gerar vídeo UGC com clone de voz

Este fluxo tutorial do ComfyUI transforma uma única imagem em um vídeo curto estilo UGC com sincronização labial e voz clonada ou selecionada. Ele encadeia três etapas: criação de prompt a partir da imagem enviada, síntese de fala com ElevenLabs e geração de vídeo com LTX‑2.3. O grupo Criar Prompt direciona a imagem do LoadImage para o GeminiNode para gerar automaticamente dois textos: um roteiro de fala pronto para performance (com tags de expressão) e uma descrição de cena. RegexExtract separa a resposta do Gemini em seções “fala” e “cena” para os nós seguintes.

Para o áudio, você pode escolher uma voz pré-definida via ElevenLabsVoiceSelector ou trazer seu próprio tom com ElevenLabsInstantVoiceClone, depois sintetizar a narração final em ElevenLabsTextToSpeech e, opcionalmente, salvar com SaveAudioMP3. O grupo Criar Vídeo alimenta a descrição da cena e o áudio no nó de vídeo LTX‑2.3 (UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12) para produzir um vídeo estilo talking-head com sincronização labial precisa, pré-visualizado por PreviewAny e gravado com SaveVideo. Essa configuração é prática para UGC rápido, explicativos de produto, depoimentos ou posts sociais porque automatiza a escrita do roteiro a partir de uma imagem e garante alinhamento voz-lábios via ElevenLabs + LTX.

API

Use este workflow a partir do código

Todo workflow Comfy é um grafo JSON. O payload abaixo é este workflow, exatamente como o ComfyUI executa — obtenha-o pela URL, mantenha-o no controle de versão ou carregue-o no ComfyUI e execute nó por nó.

template_image_speech_to_video.json
Buscando workflow JSON…

Execute a partir de TypeScript ou Python com o Comfy SDK. O mesmo código serve para o Comfy Cloud ou um ComfyUI hospedado por você — apenas a URL base muda.

// Install (beta)
npm i @comfyorg/sdk

// Run "Gerar vídeo UGC com clone de voz" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

O SDK utiliza um workflow no formato API: abra este workflow no ComfyUI e use Arquivo → Exportar Workflow (API).

O acesso à API do Comfy Cloud requer um plano com chave de API.

FAQ

Perguntas Frequentes

Ver todos os workflows
Showing 30 of 30 templates