이 ComfyUI 워크플로는 MiniMax H3(옴니모달 생성 모델)를 사용해 단일 텍스트 프롬프트만으로 네이티브 스테레오 오디오가 포함된 완성형 짧은 비디오를 만듭니다. 핵심 생성은 H3 노드(4c314f31-ecda-4b08-ae98-faaba1bf613f)가 담당하며, 한 번의 실행으로 영상, 음성, 효과음, 음악을 모두 합성합니다. ResolutionSelector가 안정적인 디코딩을 위해 32의 배수로 너비/높이를 선택하고, SaveVideo가 오디오가 내장된 최종 컨테이너를 저장합니다. 캔버스의 MarkdownNote에서 빠른 팁과 모델 링크를 확인할 수 있습니다. 일반 출력은 24fps, 약 15초, 최대 2K 해상도로, 파일 입력 없이 빠른 컨셉 시각화와 오디오 싱크 스토리텔링에 적합합니다.
내부적으로 워크플로는 MiniMax의 페어드 VAE를 사용해 두 가지 모달리티를 디코딩합니다: 프레임용 비디오 VAE(minimax_h3_video_vae_fp16.safetensors), 스테레오 사운드용 오디오 VAE(minimax_h3_audio_vae_fp32.safetensors). H3 노드의 통합 출력을 SaveVideo로 바로 연결하면, 수동 오디오 믹싱 없이 이미 동기화된 단일 MP4(또는 선택한 컨테이너)를 얻을 수 있습니다. 모델이 이미지와 오디오를 함께 생성하므로, 프롬프트의 문구가 둘 다에 영향을 줍니다: 장면, 페이싱, 오디오 큐(예: “부드러운 피아노 음악”, “타닥타닥 벽난로”, “나레이터: …”)를 함께 묘사해 한 번에 타이밍과 분위기를 조정할 수 있습니다.
FAQ




















