このComfyUIワークフローは、テキストプロンプト1つからMiniMax H3(オムニモーダル生成モデル)でステレオ音声付き短尺動画を生成します。中心となるH3ノード(4c314f31-ecda-4b08-ae98-faaba1bf613f)が、映像・ナレーション・効果音・音楽を1回の処理で同時合成します。ResolutionSelectorで32の倍数の安定した解像度を選び、SaveVideoで音声埋め込み済みの動画を出力。キャンバス上のMarkdownNoteでヒントやモデルリンクを確認できます。標準出力は約15秒・24fps・最大2K解像度。ファイル入力不要で、素早いコンセプト可視化や音声同期ストーリーテリングに最適です。

内部ではMiniMaxのペアVAEで両モダリティをデコード:動画用VAE(minimax_h3_video_vae_fp16.safetensors)と音声用VAE(minimax_h3_audio_vae_fp32.safetensors)。H3ノードの統合出力をそのままSaveVideoに渡すことで、手動ミックス不要で同期済みのMP4(または指定コンテナ)を得られます。画像と音声を同時生成するため、プロンプトの記述が両方に影響します。シーン・ペーシング・音声キュー(例:「柔らかなピアノ」「暖炉のパチパチ音」「ナレーター:…」)を記述することで、1回の生成でタイミングや雰囲気を調整できます。

FAQ

よくある質問

すべてのワークフローを見る
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates