
本 ComfyUI 教學示範如何用 Wan 2.1 FLF2V 明確控制首尾幀,生成流暢且可引導的短片。流程核心為 WanFirstLastFrameToVideo 節點,融合三種條件來源:來自 CLIPTextEncode 的提示嵌入、首尾圖像經 CLIPVisionEncode 的視覺引導,以及 UNETLoader 載入的 Wan 2.1 UNet。預設輸出 720p、16 幀(F16),產生從首幀到尾幀平滑過渡的短片。
模型元件集中於「Load Models Here」分組:VAELoader 與 VAEDecode 負責將潛在影像還原為 RGB 幀;CLIPLoader 與 CLIPTextEncode 產生正/負面提示嵌入;CLIPVisionLoader 與 CLIPVisionEncode 提取首尾圖像特徵。ModelSamplingSD3 設定 KSampler 的擴散步進排程,驅動 Wan 2.1 UNet。最後 CreateVideo 組合幀序列,SaveVideo 輸出 MP4。此流程適合需精確控制動作與構圖(如分鏡對應)同時又想保有文字風格引導的場景。
API
從程式碼使用此工作流
每個 Comfy 工作流都是一個 JSON 圖。下方的 payload 就是此工作流,與 ComfyUI 執行時完全相同 — 你可以從此 URL 取得、放入版本控制,或在 ComfyUI 載入並逐節點執行。
使用 Comfy SDK 以 TypeScript 或 Python 執行。相同程式碼可用於 Comfy Cloud 或你自架的 ComfyUI — 只需更改 base URL。
// Install (beta)
npm i @comfyorg/sdk
// Run "Wan 2.1 首尾幀影片 720p F16" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("wan2.1_flf2v_720_f16_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("52", "image", asset); // LoadImage
wf.setInput("6", "text", "glass flower blossom"); // CLIPTextEncode
const job = await client.run(wf);
await job.getOutputs("92")[0].toFile("output.png"); // SaveVideoSDK 需使用 API 格式的工作流:請在 ComfyUI 開啟此工作流,並使用 檔案 → 匯出工作流(API)。
常見問題













