음성 복제로 UGC 동영상 생성

이 ComfyUI 튜토리얼 워크플로는 단일 이미지를 짧은 립싱크 UGC 스타일 비디오로 변환하며, 복제 또는 선택한 음성을 사용할 수 있습니다. 세 단계로 구성됩니다: 업로드한 이미지에서 프롬프트 생성, ElevenLabs로 음성 합성, LTX‑2.3으로 비디오 생성. Create Prompt 그룹은 LoadImage에서 이미지를 받아 GeminiNode로 전달해 표현 태그가 포함된 연설 스크립트와 장면 설명 두 가지 텍스트를 자동 생성합니다. RegexExtract가 Gemini 응답을 파싱해 “speech”와 “scene” 섹션을 분리해 후속 노드로 전달합니다.

오디오 단계에서는 ElevenLabsVoiceSelector로 프리셋 음성을 선택하거나 ElevenLabsInstantVoiceClone으로 직접 음색을 복제할 수 있으며, 최종 내레이션은 ElevenLabsTextToSpeech에서 합성하고 필요시 SaveAudioMP3로 저장할 수 있습니다. Create Video 그룹은 장면 설명과 오디오를 LTX‑2.3 비디오 노드(UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12)에 전달해 립싱크가 정확한 토킹 스타일 비디오를 생성합니다. PreviewAny로 미리보기하고 SaveVideo로 저장합니다. 이 구성은 이미지에서 자동으로 스크립트를 작성하고, ElevenLabs + LTX로 음성-입술 정렬을 보장해 UGC, 제품 설명, 후기, 소셜 포스트에 실용적입니다.

API

코드에서 이 워크플로우 사용하기

모든 Comfy 워크플로우는 JSON 그래프입니다. 아래 페이로드는 이 워크플로우 그 자체로, ComfyUI에서 실행되는 것과 동일합니다 — URL에서 가져오거나, 버전 관리에 보관하거나, ComfyUI에서 불러와 노드별로 실행할 수 있습니다.

template_image_speech_to_video.json
워크플로우 JSON 불러오는 중…

Comfy SDK로 TypeScript 또는 Python에서 실행하세요. 동일한 코드는 Comfy Cloud 또는 직접 호스팅하는 ComfyUI 모두에 적용됩니다 — 기본 URL만 다릅니다.

// Install (beta)
npm i @comfyorg/sdk

// Run "음성 복제로 UGC 동영상 생성" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

SDK는 API 형식의 워크플로우를 사용합니다: 이 워크플로우를 ComfyUI에서 열고 파일 → 워크플로우 내보내기(API)를 사용하세요.

Comfy Cloud API 접근은 API 키가 포함된 요금제가 필요합니다.

FAQ

자주 묻는 질문

모든 워크플로우 보기
Showing 30 of 30 templates