Este fluxo de trabalho ComfyUI transforma um único prompt de texto em um vídeo curto completo com áudio estéreo nativo usando o MiniMax H3, um modelo generativo omni-modal. A geração principal é feita pelo nó H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), que sintetiza visual, voz, efeitos sonoros e música em uma única passagem. O ResolutionSelector escolhe um par de largura/altura válido (múltiplos de 32) para decodificação estável, enquanto o SaveVideo salva o arquivo final com áudio embutido. Um MarkdownNote no canvas traz dicas rápidas e links dos modelos. As saídas típicas têm cerca de 15 segundos a 24 fps e podem chegar a 2K de resolução—ideal para visualização rápida de conceitos e storytelling sincronizado com áudio sem arquivos de entrada.
Nos bastidores, o fluxo usa os VAEs pareados do MiniMax para decodificar ambas as modalidades: um VAE de vídeo (minimax_h3_video_vae_fp16.safetensors) para os quadros e um VAE de áudio (minimax_h3_audio_vae_fp32.safetensors) para som estéreo. Ao encaminhar a saída unificada do nó H3 diretamente para o SaveVideo, você obtém um único MP4 (ou container escolhido) já sincronizado, sem necessidade de mixagem manual de áudio. Como o modelo gera imagem e áudio juntos, o texto do prompt direciona ambos: você pode descrever cenas, ritmo e dicas de áudio (ex: “música de piano suave”, “lareira crepitando” ou “narrador: ...”) para moldar o tempo e o tom em uma só passagem.
FAQ




















