이 ComfyUI 워크플로는 MiniMax H3(옴니모달 생성 모델)를 사용해 단일 텍스트 프롬프트만으로 네이티브 스테레오 오디오가 포함된 완성형 짧은 비디오를 만듭니다. 핵심 생성은 H3 노드(4c314f31-ecda-4b08-ae98-faaba1bf613f)가 담당하며, 한 번의 실행으로 영상, 음성, 효과음, 음악을 모두 합성합니다. ResolutionSelector가 안정적인 디코딩을 위해 32의 배수로 너비/높이를 선택하고, SaveVideo가 오디오가 내장된 최종 컨테이너를 저장합니다. 캔버스의 MarkdownNote에서 빠른 팁과 모델 링크를 확인할 수 있습니다. 일반 출력은 24fps, 약 15초, 최대 2K 해상도로, 파일 입력 없이 빠른 컨셉 시각화와 오디오 싱크 스토리텔링에 적합합니다.

내부적으로 워크플로는 MiniMax의 페어드 VAE를 사용해 두 가지 모달리티를 디코딩합니다: 프레임용 비디오 VAE(minimax_h3_video_vae_fp16.safetensors), 스테레오 사운드용 오디오 VAE(minimax_h3_audio_vae_fp32.safetensors). H3 노드의 통합 출력을 SaveVideo로 바로 연결하면, 수동 오디오 믹싱 없이 이미 동기화된 단일 MP4(또는 선택한 컨테이너)를 얻을 수 있습니다. 모델이 이미지와 오디오를 함께 생성하므로, 프롬프트의 문구가 둘 다에 영향을 줍니다: 장면, 페이싱, 오디오 큐(예: “부드러운 피아노 음악”, “타닥타닥 벽난로”, “나레이터: …”)를 함께 묘사해 한 번에 타이밍과 분위기를 조정할 수 있습니다.

FAQ

자주 묻는 질문

모든 워크플로우 보기
Character
Cinematic
Image to Video
Lip Sync
Multiple Angles
Portrait
Style Reference
Style Transfer
Text to Video
Video Generation
Video
Showing 30 of 30 templates