Este flujo de trabajo de ComfyUI convierte un solo prompt de texto en un video corto completo con audio estéreo nativo usando MiniMax H3, un modelo generativo omni-modal. La generación principal la realiza el nodo H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), que sintetiza conjuntamente visuales, voz, efectos de sonido y música en una sola pasada. ResolutionSelector elige un par de ancho/alto válido (múltiplos de 32) para una decodificación estable, mientras que SaveVideo guarda el contenedor final con audio embebido. Una MarkdownNote en el canvas ofrece consejos rápidos y enlaces a los modelos. Las salidas típicas son de ~15 segundos a 24 fps y pueden llegar hasta 2K de resolución—ideal para visualización rápida de conceptos y narrativas sincronizadas con audio sin archivos de entrada.
Internamente, el flujo de trabajo usa los VAEs emparejados de MiniMax para decodificar ambas modalidades: un VAE de video (minimax_h3_video_vae_fp16.safetensors) para los fotogramas y un VAE de audio (minimax_h3_audio_vae_fp32.safetensors) para el sonido estéreo. Al enrutar la salida unificada del nodo H3 directamente a SaveVideo, obtienes un solo MP4 (u otro contenedor elegido) ya sincronizado, sin necesidad de mezclar audio manualmente. Como el modelo genera imagen y audio juntos, el wording del prompt guía ambos: puedes describir escenas, ritmo y cues de audio (ejemplo: “música de piano suave”, “chimenea crepitando” o “narrador: …”) para definir el timing y tono en una sola pasada.
Preguntas frecuentes




















