
此 ComfyUI 教學工作流程將單張圖片轉成短片,並加入語音驅動的敘事,同時維持強烈的視覺辨識度與「看起來」一致的口型對齊。它結合 Lightricks LTX 2.3 進行影片生成,並使用 ID-LoRA(CelebVHQ)在多影格中維持主體臉部與造型一致;同時由 Qwen 3 TTS 生成匹配的語音音軌。管線依群組清楚整理:Load Image、Create Prompts、Prompt Extraction、Create Voice、Create Video。
在底層,GeminiNode 會分析你上傳的圖片(透過 LoadImage),並草擬兩段互補文字:一段包含表情線索的台詞,以及一段場景/外觀描述。RegexExtract 會把它們解析成適用於 ID-LoRA 的格式,分成三個標記區塊:[VISUAL]、[SPEECH]、[SOUNDS]。FB_Qwen3TTSCustomVoice 使用 [SPEECH] 與 [SOUNDS] 的風格提示來合成語音,並用 SaveAudioMP3 儲存。此節點圖中的 LTX 2.3 影片節點(自訂節點)會消耗結構化提示詞與你的參考圖片來渲染說話影片,而 CelebVHQ ID-LoRA 在動態、生活感場景中可提升身分一致性。PreviewAny 讓你快速迭代,SaveVideo 則輸出最終片段。本機使用者也可選擇載入 LTX 空間超解析模型(ltx-2.3-spatial-upscaler-x2-1.1.safetensors),在較高解析度下獲得更乾淨的細節。
API
從程式碼使用此工作流
每個 Comfy 工作流都是一個 JSON 圖。下方的 payload 就是此工作流,與 ComfyUI 執行時完全相同 — 你可以從此 URL 取得、放入版本控制,或在 ComfyUI 載入並逐節點執行。
使用 Comfy SDK 以 TypeScript 或 Python 執行。相同程式碼可用於 Comfy Cloud 或你自架的 ComfyUI — 只需更改 base URL。
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDK 需使用 API 格式的工作流:請在 ComfyUI 開啟此工作流,並使用 檔案 → 匯出工作流(API)。
常見問題













