Создать UGC-видео с клоном голоса

Этот обучающий Рабочий процесс ComfyUI превращает одно изображение в короткое UGC-видео с липсинком и клонированным или выбранным голосом. Он связывает три этапа: создание промпта по загруженному изображению, синтез речи в ElevenLabs и генерацию видео в LTX‑2.3. Группа Create Prompt направляет изображение из LoadImage в GeminiNode, чтобы автоматически сгенерировать два текста: сценарий речи, готовый для исполнения (с тегами выражений), и описание сцены. RegexExtract разбирает ответ Gemini и аккуратно отделяет разделы «speech» и «scene» для следующих нод.

Для аудио Вы можете выбрать готовый голос через ElevenLabsVoiceSelector или использовать собственный тембр через ElevenLabsInstantVoiceClone, затем синтезировать итоговую озвучку в ElevenLabsTextToSpeech и при желании сохранить её через SaveAudioMP3. Группа Create Video передаёт описание сцены и аудио в видеоноду LTX‑2.3 (UUID: 98fb87e2-23b5-4ecb-aacc-365912414a12), чтобы получить talking-ролик с точным липсинком, который можно просмотреть через PreviewAny и сохранить через SaveVideo. Схема подходит для быстрого UGC, продуктовых объяснений, отзывов или постов в соцсетях, потому что автоматизирует написание текста по изображению и удерживает синхронизацию губ и голоса через ElevenLabs + LTX.

API

Использовать этот рабочий процесс из кода

Каждый рабочий процесс Comfy — это JSON-граф. Ниже представлен payload этого процесса, точно так же, как его запускает ComfyUI: получите его по ссылке, храните в системе контроля версий или загрузите в ComfyUI и выполняйте по узлам.

template_image_speech_to_video.json
Загрузка JSON рабочего процесса…

Запустите его на TypeScript или Python с помощью Comfy SDK. Один и тот же код работает с Comfy Cloud или вашим собственным ComfyUI — меняется только базовый URL.

// Install (beta)
npm i @comfyorg/sdk

// Run "Создать UGC-видео с клоном голоса" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("template_image_speech_to_video_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("440", "image", asset); // LoadImage

const job = await client.run(wf);
await job.getOutputs("445")[0].toFile("output.png"); // SaveAudioMP3

SDK принимает рабочий процесс в API-формате: откройте этот процесс в ComfyUI и используйте Файл → Экспортировать рабочий процесс (API).

Доступ к API Comfy Cloud требует плана с API-ключом.

FAQ

Часто Задаваемые Вопросы

Посмотреть все воркфлоу
Showing 30 of 30 templates