音声クローンでUGC動画を生成

このComfyUIチュートリアルワークフローは、1枚の画像から、クローン音声または選択した音声を使った短いリップシンク付きUGC風動画を作ります。3段階で構成されています:アップロード画像からのプロンプト作成、ElevenLabsでの音声合成、LTX‑2.3での動画生成です。Create PromptグループではLoadImageからの画像をGeminiNodeに渡し、2種類のテキスト(演技用の発話台本〈表現タグ付き〉と、シーン説明)を自動生成します。RegexExtractがGeminiの返答から「speech」と「scene」セクションを分離し、後段ノードに渡します。

音声は、ElevenLabsVoiceSelectorでプリセット音声を選ぶか、ElevenLabsInstantVoiceCloneで独自の声質を持ち込み、ElevenLabsTextToSpeechで最終ナレーションを合成し、必要ならSaveAudioMP3で保存できます。Create Videoグループでは、シーン説明と音声をLTX‑2.3の動画ノード(UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12)に入力して、精度の高いリップシンクのトーキング動画を生成し、PreviewAnyでプレビューしてSaveVideoで書き出します。この構成は、画像から台本作成を自動化し、ElevenLabs + LTXで音声と口の動きを揃えられるため、UGC、商品解説、体験談、SNS投稿の制作に向いています。

API

このワークフローをコードから利用

すべてのComfyワークフローはJSONグラフです。以下のペイロードは、このワークフローそのものであり、ComfyUIが実行する内容と同じです — このURLから取得し、バージョン管理に保存したり、ComfyUIで読み込んでノードごとに実行できます。

template_image_speech_to_video.json
ワークフローJSONを取得中…

Comfy SDKを使ってTypeScriptまたはPythonから実行できます。同じコードでComfy Cloudや自身でホストしたComfyUIのどちらにも対応 — ベースURLだけが異なります。

// Install (beta)
npm i @comfyorg/sdk

// Run "音声クローンでUGC動画を生成" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

SDKはAPI形式のワークフローを受け取ります:このワークフローをComfyUIで開き、「ファイル → ワークフローをエクスポート(API)」を使用してください。

Comfy Cloud APIアクセスにはAPIキー付きプランが必要です。

FAQ

よくある質問

すべてのワークフローを見る
Showing 30 of 30 templates