Este flujo de trabajo de ComfyUI convierte un solo prompt de texto en un video corto completo con audio estéreo nativo usando MiniMax H3, un modelo generativo omni-modal. La generación principal la realiza el nodo H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), que sintetiza conjuntamente visuales, voz, efectos de sonido y música en una sola pasada. ResolutionSelector elige un par de ancho/alto válido (múltiplos de 32) para una decodificación estable, mientras que SaveVideo guarda el contenedor final con audio embebido. Una MarkdownNote en el canvas ofrece consejos rápidos y enlaces a los modelos. Las salidas típicas son de ~15 segundos a 24 fps y pueden llegar hasta 2K de resolución—ideal para visualización rápida de conceptos y narrativas sincronizadas con audio sin archivos de entrada.

Internamente, el flujo de trabajo usa los VAEs emparejados de MiniMax para decodificar ambas modalidades: un VAE de video (minimax_h3_video_vae_fp16.safetensors) para los fotogramas y un VAE de audio (minimax_h3_audio_vae_fp32.safetensors) para el sonido estéreo. Al enrutar la salida unificada del nodo H3 directamente a SaveVideo, obtienes un solo MP4 (u otro contenedor elegido) ya sincronizado, sin necesidad de mezclar audio manualmente. Como el modelo genera imagen y audio juntos, el wording del prompt guía ambos: puedes describir escenas, ritmo y cues de audio (ejemplo: “música de piano suave”, “chimenea crepitando” o “narrador: …”) para definir el timing y tono en una sola pasada.

Preguntas frecuentes

Preguntas Frecuentes

Ver todos los workflows
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates