Ce workflow ComfyUI transforme une simple invite texte en une vidéo courte complète avec audio stéréo natif grâce à MiniMax H3, un modèle génératif omni-modal. La génération principale est assurée par le nœud H3 (4c314f31-ecda-4b08-ae98-faaba1bf613f), qui synthétise ensemble visuels, voix, effets sonores et musique en un seul passage. ResolutionSelector choisit une largeur/hauteur valide (multiples de 32) pour un décodage stable, tandis que SaveVideo écrit le fichier final avec audio intégré. Une MarkdownNote sur le canevas fournit des conseils rapides et des liens vers les modèles. Les sorties typiques font ~15 secondes à 24 fps et peuvent atteindre 2K — idéal pour la visualisation rapide de concepts et la narration synchronisée sans aucun fichier en entrée.

En coulisse, le workflow utilise les VAEs jumelés de MiniMax pour décoder les deux modalités : un VAE vidéo (minimax_h3_video_vae_fp16.safetensors) pour les images et un VAE audio (minimax_h3_audio_vae_fp32.safetensors) pour le son stéréo. En connectant directement la sortie unifiée du nœud H3 à SaveVideo, vous obtenez un seul MP4 (ou autre conteneur choisi) déjà synchronisé, sans mixage audio manuel. Comme le modèle génère image et audio ensemble, la formulation de l'invite guide les deux : vous pouvez décrire scènes, rythme et indices audio (ex : « musique de piano douce », « feu de cheminée crépitant », ou « narrateur : … ») pour façonner le timing et le ton en un seul passage.

FAQ

Questions Fréquentes

Voir tous les workflows
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates