Este fluxo de trabalho ComfyUI transforma um único prompt de texto em um vídeo curto completo com áudio estéreo nativo usando o MiniMax H3, um modelo generativo omni-modal. A geração principal é feita pelo nó H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), que sintetiza visual, voz, efeitos sonoros e música em uma única passagem. O ResolutionSelector escolhe um par de largura/altura válido (múltiplos de 32) para decodificação estável, enquanto o SaveVideo salva o arquivo final com áudio embutido. Um MarkdownNote no canvas traz dicas rápidas e links dos modelos. As saídas típicas têm cerca de 15 segundos a 24 fps e podem chegar a 2K de resolução—ideal para visualização rápida de conceitos e storytelling sincronizado com áudio sem arquivos de entrada.

Nos bastidores, o fluxo usa os VAEs pareados do MiniMax para decodificar ambas as modalidades: um VAE de vídeo (minimax_h3_video_vae_fp16.safetensors) para os quadros e um VAE de áudio (minimax_h3_audio_vae_fp32.safetensors) para som estéreo. Ao encaminhar a saída unificada do nó H3 diretamente para o SaveVideo, você obtém um único MP4 (ou container escolhido) já sincronizado, sem necessidade de mixagem manual de áudio. Como o modelo gera imagem e áudio juntos, o texto do prompt direciona ambos: você pode descrever cenas, ritmo e dicas de áudio (ex: “música de piano suave”, “lareira crepitando” ou “narrador: ...”) para moldar o tempo e o tom em uma só passagem.

FAQ

Perguntas Frequentes

Ver todos os workflows
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates