MiniMax H3, 33B 영상·오디오 생성 모델로 Hugging Face에 등장
Original: MiniMax H3 lands on Hugging Face as a 33B audio-video model View original →
영상과 오디오를 한 모델 카드에 묶은 H3
생성형 영상 모델 경쟁은 폐쇄형 데모만의 영역이 아니다. Hugging Face에서 공유된 MiniMax H3는 텍스트-투-비디오, 이미지-투-비디오, 참조 기반 비디오를 오디오와 함께 다루는 33B 파라미터 모델로 소개됐다. 2026년 8월 3일 multimodalart 계정은 H3가 Hugging Face에 올라왔고 Diffusers와 ComfyUI에서 사용할 수 있다고 적었다.
MiniMax H3 just dropped on Hugging Face — text-to-video, image-to-video, reference-to-video — all with audio.
Hugging Face 모델 카드에 따르면 MiniMax H3는 텍스트, 이미지, 비디오, 오디오로 구성된 멀티모달 컨텍스트를 이해하고, 4~15초 길이의 영상을 24 FPS로 생성한다. 기본 shorter side는 768픽셀이며 H3-Regenerate-2K를 통해 2K 생성도 가능하다고 설명한다. 오디오는 32 kHz 스테레오이며, 안정 지원 언어 목록에는 한국어, 영어, 일본어를 포함한 11개 언어가 들어 있다.
multimodalart는 Hugging Face Spaces와 Diffusers 기반 데모를 자주 공유하는 계정이다. 이번 트윗은 단순 홍보를 넘어서, 모델 가중치와 Spaces 앱, Diffusers 사용 경로가 함께 공개됐다는 점에서 개발자에게 실질적이다. 컬렉션에는 MiniMaxAI/MiniMax-H3 모델, reference 데모, Qwen3-VL conditioner가 묶여 있다.
다음 관전점은 라이선스와 실제 실행 비용이다. 33B 규모 모델이 소비자 GPU에서 어느 수준까지 현실적으로 동작하는지, 2K 생성과 참조 입력 기능이 공개 경로에서 얼마나 안정적으로 제공되는지가 채택 속도를 결정할 것이다. Source tweet
Related Articles
NVIDIA Research의 MOTIVE는 video model fine-tuning에서 움직임에 실제로 기여하는 clip을 골라내는 방법이다. ICML 2026 Outstanding Paper Honorable Mention을 받았고, base model 대비 74.1% human preference를 기록했다.
Meta가 Muse Image를 Meta AI, meta.ai, 미국 Instagram Stories, 일부 국가의 WhatsApp에 투입했다. 이미지 생성 모델이 검색·코드 실행·자기수정을 쓰고, Arena 기준 3개 이미지 작업에서 모두 2위에 오른 점이 핵심이다.
평가용으로 안전장치를 낮춘 모델이 Hugging Face 보안 사고와 연결됐다는 공개 설명에 관심이 모였다. 논점은 단순한 침해 사실보다, cyber benchmark가 실제 인프라와 만날 때 통제 경계가 어디까지 버티는가다.