
이 ComfyUI 워크플로는 단일 레퍼런스 이미지와 오디오 트랙을 Wan 2.2 S2V(sound-to-video) 모델로 동기화된 비디오로 변환합니다. UNETLoader, CLIPLoader, VAELoader로 Wan 백본을 로드하고 ModelSamplingSD3로 올바른 스케줄을 설정합니다. 텍스트 프롬프트는 CLIPTextEncode로 인코딩되고, 오디오는 AudioEncoderLoader 및 AudioEncoderEncode로 처리됩니다. 이 신호들과 LoadImage의 이미지가 함께 WanSoundImageToVideo를 구동하여 오디오의 리듬과 프레이징을 따르는 모션을 합성합니다. KSampler는 스텝, CFG, 시드를 제어하며, VAEDecode는 잠재 데이터를 프레임으로 변환하고 CreateVideo가 최종 클립을 조립합니다.
프로덕션에서 실용적인 두 가지 엔지니어링 요소가 포함되어 있습니다. 첫째는 첫 프레임 안정화, 둘째는 길이 확장입니다. Fix overbaked first frame 그룹은 LatentCut과 LatentConcat으로 초기 잠재 프레임을 디코딩 전에 복제한 다음, 디코딩된 첫 프레임을 버려 0프레임에서 흔히 나타나는 VAE의 "오버베이크" 현상을 피합니다. 긴 클립의 경우 Video S2V Extend 서브그래프를 사용해 LatentCut/LatentConcat으로 세그먼트를 기본 77프레임 단위로 체인 연결할 수 있어 VRAM을 과도하게 사용하지 않고 분 단위 비디오를 만들 수 있습니다. 또한 라이트닝 경로도 지원합니다. Wan 2.2 lightning LoRA를 사용하면 4 스텝(권장 CFG ~1.0)으로 샘플링할 수 있습니다. 품질과 안정성을 우선한다면 표준 경로에서 ~20 스텝(CFG ~6.0)을 사용하세요.
API
코드에서 이 워크플로우 사용하기
모든 Comfy 워크플로우는 JSON 그래프입니다. 아래 페이로드는 이 워크플로우 그 자체로, ComfyUI에서 실행되는 것과 동일합니다 — URL에서 가져오거나, 버전 관리에 보관하거나, ComfyUI에서 불러와 노드별로 실행할 수 있습니다.
Comfy SDK로 TypeScript 또는 Python에서 실행하세요. 동일한 코드는 Comfy Cloud 또는 직접 호스팅하는 ComfyUI 모두에 적용됩니다 — 기본 URL만 다릅니다.
// Install (beta)
npm i @comfyorg/sdk
// Run "Wan2.2-S2V 오디오 구동 비디오 생성" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("video_wan2_2_14B_s2v_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("52", "image", asset); // LoadImage
wf.setInput("6", "text", "your prompt here"); // CLIPTextEncode
const job = await client.run(wf);
await job.getOutputs("113")[0].toFile("output.png"); // SaveVideoSDK는 API 형식의 워크플로우를 사용합니다: 이 워크플로우를 ComfyUI에서 열고 파일 → 워크플로우 내보내기(API)를 사용하세요.
FAQ













