
这个 ComfyUI 教程工作流可把单张图像转成短视频,并配上语音驱动的内容,同时保持较强的视觉一致性与“观感上的口型对齐”。它将 Lightricks LTX 2.3 用于视频生成,并结合 ID-LoRA(CelebVHQ)以在多帧间保持主体的人脸与造型一致;同时用 Qwen 3 TTS 生成匹配的语音轨。整条管线按组组织:Load Image、Create Prompts、Prompt Extraction、Create Voice、Create Video。
在内部流程上,GeminiNode 会分析你上传的图像(通过 LoadImage),并生成两段互补文本:带表情提示的台词,以及场景/外观描述。RegexExtract 会将这些内容解析为适合 ID-LoRA 的格式,分成三段标签:[VISUAL]、[SPEECH]、[SOUNDS]。FB_Qwen3TTSCustomVoice 使用 [SPEECH] 与 [SOUNDS] 中的风格提示合成语音,并用 SaveAudioMP3 保存。LTX 2.3 视频节点(该画面中的自定义节点)会读取结构化提示词和参考图像来渲染口播视频;CelebVHQ ID-LoRA 可在动态、复杂场景下提升身份一致性。PreviewAny 便于快速迭代,SaveVideo 输出最终片段。本地用户还可选加载 LTX 空间放大器(ltx-2.3-spatial-upscaler-x2-1.1.safetensors)以在更高分辨率下获得更干净的细节。
API
通过代码使用此工作流
每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。
使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。
常见问题













