此 ComfyUI 工作流程可將單一文字提示轉換為完整短片,含原生立體聲音訊,採用 MiniMax H3 全模態生成模型。核心生成由 H3 節點(4c314f31-ecda-4b08-ae98-faaba1bf613f)負責,單次運算即可同時合成畫面、語音、音效與音樂。ResolutionSelector 會選擇穩定解碼所需的 32 倍數寬高,SaveVideo 則將最終影片(含音訊)寫入檔案。畫布上的 MarkdownNote 提供快速提示與模型連結。典型輸出約 15 秒、24 fps,最高可達 2K 解析度,適合快速概念視覺化與音訊同步敘事,無需任何檔案輸入。

流程底層會用 MiniMax 配對的 VAE 解碼兩種模態:影片 VAE(minimax_h3_video_vae_fp16.safetensors)負責畫格,音訊 VAE(minimax_h3_audio_vae_fp32.safetensors)負責立體聲。H3 節點的統一輸出直接連到 SaveVideo,即可得到同步的單一 MP4(或其他格式),無需手動混音。由於模型同時生成影像與音訊,提示詞內容會同時引導兩者:你可描述場景、節奏與音效(如「柔和鋼琴音樂」、「壁爐劈啪聲」、「旁白:……」),一次決定時序與氛圍。

常見問題

常見問題

查看所有工作流
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates