使用语音克隆生成UGC视频

这个 ComfyUI 教程工作流可将单张图像转换为一段短的、口型同步的 UGC 风格视频,并支持克隆或选择声音。它串联三个阶段:基于你上传图像创建提示词、用 ElevenLabs 进行语音合成、再用 LTX‑2.3 生成视频。Create Prompt 组将 LoadImage 的图像输入到 GeminiNode,自动生成两段文本:可直接用于表演的口播脚本(带表情标签)和场景描述。RegexExtract 会解析 Gemini 的回复,把“speech”和“scene”部分干净分离,供后续节点使用。

在音频部分,你可以通过 ElevenLabsVoiceSelector 选择预设声音,或用 ElevenLabsInstantVoiceClone 克隆自己的音色,然后在 ElevenLabsTextToSpeech 合成最终旁白,并可选用 SaveAudioMP3 保存。Create Video 组将场景描述与音频输入到 LTX‑2.3 视频节点(UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12),生成口型同步准确的“对口型”视频,通过 PreviewAny 预览并用 SaveVideo 写出。该设置适合快速制作 UGC、产品讲解、证言/测评或社交短视频,因为它能从图像自动生成脚本,并通过 ElevenLabs + LTX 保证声音与口型对齐。

API

通过代码使用此工作流

每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。

template_image_speech_to_video.json
正在获取工作流 JSON…

使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。

// Install (beta)
npm i @comfyorg/sdk

// Run "使用语音克隆生成UGC视频" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

SDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。

Comfy Cloud API 访问需要包含 API 密钥的套餐。

常见问题

常见问题

查看所有工作流
Showing 30 of 30 templates