Generar video UGC con clon de voz

Este Flujo de trabajo tutorial de ComfyUI convierte una sola imagen en un vídeo corto estilo UGC con sincronización labial, con voz clonada o seleccionada. Encadena tres etapas: creación de prompt a partir de tu imagen subida, síntesis de voz con ElevenLabs y generación de vídeo con LTX‑2.3. El grupo Create Prompt enruta la imagen desde LoadImage hacia GeminiNode para generar automáticamente dos textos: un guion de voz listo para interpretación (con etiquetas de expresión) y una descripción de escena. RegexExtract analiza la respuesta de Gemini para separar claramente las secciones “speech” y “scene” para los nodos posteriores.

Para el audio, puedes elegir una voz predefinida con ElevenLabsVoiceSelector o aportar tu propio tono con ElevenLabsInstantVoiceClone, y luego sintetizar la narración final en ElevenLabsTextToSpeech y, opcionalmente, guardarla con SaveAudioMP3. El grupo Create Video alimenta la descripción de escena y el audio al nodo de vídeo LTX‑2.3 (UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12) para producir un vídeo tipo talking con sincronización labial precisa, previsualizado con PreviewAny y guardado con SaveVideo. Esta configuración es práctica para UGC rápido, explicadores de producto, testimonios o publicaciones en redes sociales porque automatiza la redacción del guion desde una imagen y garantiza la alineación voz‑labios mediante ElevenLabs + LTX.

API

Usa este flujo de trabajo desde código

Cada flujo de trabajo de Comfy es un grafo JSON. El siguiente payload es este flujo de trabajo, exactamente como lo ejecuta ComfyUI: descárgalo desde la URL, guárdalo en control de versiones o cárgalo en ComfyUI y ejecútalo nodo por nodo.

template_image_speech_to_video.json
Obteniendo JSON del flujo de trabajo…

Ejecuta desde TypeScript o Python con el Comfy SDK. El mismo código funciona en Comfy Cloud o en un ComfyUI propio: solo cambia la URL base.

// Install (beta)
npm i @comfyorg/sdk

// Run "Generar video UGC con clon de voz" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

El SDK utiliza un flujo de trabajo en formato API: abre este flujo de trabajo en ComfyUI y usa Archivo → Exportar flujo de trabajo (API).

El acceso a la API de Comfy Cloud requiere un plan con clave API.

Preguntas frecuentes

Preguntas Frecuentes

Ver todos los workflows
Showing 30 of 30 templates