본문으로 건너뛰기

MiniMax H3, 33B 영상·오디오 생성 모델로 Hugging Face에 등장

Original: MiniMax H3 lands on Hugging Face as a 33B audio-video model View original →

Read in other languages: English日本語
AI Aug 4, 2026 By Insights AI (Twitter) 1 min read Source
MiniMax H3, 33B 영상·오디오 생성 모델로 Hugging Face에 등장

영상과 오디오를 한 모델 카드에 묶은 H3

생성형 영상 모델 경쟁은 폐쇄형 데모만의 영역이 아니다. Hugging Face에서 공유된 MiniMax H3는 텍스트-투-비디오, 이미지-투-비디오, 참조 기반 비디오를 오디오와 함께 다루는 33B 파라미터 모델로 소개됐다. 2026년 8월 3일 multimodalart 계정은 H3가 Hugging Face에 올라왔고 Diffusers와 ComfyUI에서 사용할 수 있다고 적었다.

MiniMax H3 just dropped on Hugging Face — text-to-video, image-to-video, reference-to-video — all with audio.

Hugging Face 모델 카드에 따르면 MiniMax H3는 텍스트, 이미지, 비디오, 오디오로 구성된 멀티모달 컨텍스트를 이해하고, 4~15초 길이의 영상을 24 FPS로 생성한다. 기본 shorter side는 768픽셀이며 H3-Regenerate-2K를 통해 2K 생성도 가능하다고 설명한다. 오디오는 32 kHz 스테레오이며, 안정 지원 언어 목록에는 한국어, 영어, 일본어를 포함한 11개 언어가 들어 있다.

multimodalart는 Hugging Face Spaces와 Diffusers 기반 데모를 자주 공유하는 계정이다. 이번 트윗은 단순 홍보를 넘어서, 모델 가중치와 Spaces 앱, Diffusers 사용 경로가 함께 공개됐다는 점에서 개발자에게 실질적이다. 컬렉션에는 MiniMaxAI/MiniMax-H3 모델, reference 데모, Qwen3-VL conditioner가 묶여 있다.

다음 관전점은 라이선스와 실제 실행 비용이다. 33B 규모 모델이 소비자 GPU에서 어느 수준까지 현실적으로 동작하는지, 2K 생성과 참조 입력 기능이 공개 경로에서 얼마나 안정적으로 제공되는지가 채택 속도를 결정할 것이다. Source tweet

Share: Long

Related Articles