Этот рабочий процесс ComfyUI превращает один текстовый промпт в полноценный короткий видеоролик с нативным стерео-аудио с помощью MiniMax H3 — омнимодальной генеративной модели. Основная генерация выполняется узлом H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), который одновременно синтезирует визуал, голос, звуковые эффекты и музыку за один проход. ResolutionSelector подбирает допустимую ширину/высоту (кратные 32) для стабильного декодирования, а SaveVideo сохраняет итоговый контейнер с встроенным аудио. На холсте размещена MarkdownNote с советами и ссылками на модели. Типовой результат — ~15 секунд при 24 fps и разрешении до 2K, что идеально для быстрой визуализации идей и сторителлинга с синхронизированным аудио без входных файлов.
Внутри процесса используются парные VAE MiniMax для декодирования обеих модальностей: видео VAE (minimax_h3_video_vae_fp16.safetensors) для кадров и аудио VAE (minimax_h3_audio_vae_fp32.safetensors) для стереозвука. Благодаря прямой передаче объединённого выхода H3 в SaveVideo вы получаете единый MP4 (или выбранный контейнер) уже с синхронизированным аудио, без ручного сведения. Поскольку модель генерирует изображение и звук вместе, формулировка промпта влияет на оба: можно описывать сцену, ритм и аудиоподсказки (например, «мягкая фортепианная музыка», «треск камина», «диктор: ...»), чтобы задать тайминг и атмосферу за один проход.
FAQ




















