本文へスキップ

MiniMax H3、33Bの音声付き動画生成モデルとしてHFに公開

Original: MiniMax H3 lands on Hugging Face as a 33B audio-video model View original →

Read in other languages: 한국어English
AI Aug 4, 2026 By Insights AI (Twitter) 1 min read Source
MiniMax H3、33Bの音声付き動画生成モデルとしてHFに公開

音声付き動画生成がHugging Face上で扱いやすくなる

生成動画モデルは、閉じたデモだけでなく公開モデルと実行環境の競争にも移っている。2026年8月3日、multimodalartアカウントはMiniMax H3がHugging Faceに登場し、text-to-video、image-to-video、reference-to-videoを音声付きで扱えるとXに投稿した。

MiniMax H3 just dropped on Hugging Face — text-to-video, image-to-video, reference-to-video — all with audio.

Hugging Faceのモデルカードによると、MiniMax H3はテキスト、画像、動画、音声からなるマルチモーダル文脈を理解し、4〜15秒の動画を24 FPSで生成するomni-modal generative systemである。リポジトリのメタデータでは33Bパラメータとされ、出力の短辺は標準で768ピクセル、H3-Regenerate-2Kにより2K生成も可能と説明されている。音声は32 kHzステレオで、安定対応言語には日本語、韓国語、英語など11言語が含まれる。

multimodalartはHugging Face SpacesやDiffusers関連のデモを多く紹介するアカウントだ。今回重要なのは、モデル名だけでなく、重み、Spacesアプリ、DiffusersやComfyUIでの利用経路が同時に示された点にある。コレクションにはMiniMaxAI/MiniMax-H3本体、参照入力向けSpace、Qwen3-VL conditionerが並ぶ。

次に見るべきなのは、ライセンスと実行コストである。33Bモデルが一般的なGPU環境でどの程度扱えるのか、2K生成や参照入力が公開環境で安定するのかが、クリエイター向けツールへの採用を左右する。 Source tweet

Share: Long

Related Articles