Этот рабочий процесс ComfyUI превращает один текстовый промпт в полноценный короткий видеоролик с нативным стерео-аудио с помощью MiniMax H3 — омнимодальной генеративной модели. Основная генерация выполняется узлом H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), который одновременно синтезирует визуал, голос, звуковые эффекты и музыку за один проход. ResolutionSelector подбирает допустимую ширину/высоту (кратные 32) для стабильного декодирования, а SaveVideo сохраняет итоговый контейнер с встроенным аудио. На холсте размещена MarkdownNote с советами и ссылками на модели. Типовой результат — ~15 секунд при 24 fps и разрешении до 2K, что идеально для быстрой визуализации идей и сторителлинга с синхронизированным аудио без входных файлов.

Внутри процесса используются парные VAE MiniMax для декодирования обеих модальностей: видео VAE (minimax_h3_video_vae_fp16.safetensors) для кадров и аудио VAE (minimax_h3_audio_vae_fp32.safetensors) для стереозвука. Благодаря прямой передаче объединённого выхода H3 в SaveVideo вы получаете единый MP4 (или выбранный контейнер) уже с синхронизированным аудио, без ручного сведения. Поскольку модель генерирует изображение и звук вместе, формулировка промпта влияет на оба: можно описывать сцену, ритм и аудиоподсказки (например, «мягкая фортепианная музыка», «треск камина», «диктор: ...»), чтобы задать тайминг и атмосферу за один проход.

FAQ

Часто Задаваемые Вопросы

Посмотреть все воркфлоу
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates