MiniMax H3、33Bの音声付き動画生成モデルとしてHFに公開
Original: MiniMax H3 lands on Hugging Face as a 33B audio-video model View original →
音声付き動画生成がHugging Face上で扱いやすくなる
生成動画モデルは、閉じたデモだけでなく公開モデルと実行環境の競争にも移っている。2026年8月3日、multimodalartアカウントはMiniMax H3がHugging Faceに登場し、text-to-video、image-to-video、reference-to-videoを音声付きで扱えるとXに投稿した。
MiniMax H3 just dropped on Hugging Face — text-to-video, image-to-video, reference-to-video — all with audio.
Hugging Faceのモデルカードによると、MiniMax H3はテキスト、画像、動画、音声からなるマルチモーダル文脈を理解し、4〜15秒の動画を24 FPSで生成するomni-modal generative systemである。リポジトリのメタデータでは33Bパラメータとされ、出力の短辺は標準で768ピクセル、H3-Regenerate-2Kにより2K生成も可能と説明されている。音声は32 kHzステレオで、安定対応言語には日本語、韓国語、英語など11言語が含まれる。
multimodalartはHugging Face SpacesやDiffusers関連のデモを多く紹介するアカウントだ。今回重要なのは、モデル名だけでなく、重み、Spacesアプリ、DiffusersやComfyUIでの利用経路が同時に示された点にある。コレクションにはMiniMaxAI/MiniMax-H3本体、参照入力向けSpace、Qwen3-VL conditionerが並ぶ。
次に見るべきなのは、ライセンスと実行コストである。33Bモデルが一般的なGPU環境でどの程度扱えるのか、2K生成や参照入力が公開環境で安定するのかが、クリエイター向けツールへの採用を左右する。 Source tweet
Related Articles
MetaはMuse ImageをMeta AI、meta.ai、米国のInstagram Stories、一部国のWhatsAppに投入した。検索、コード実行、自己修正、Content Sealを備えた画像生成がソーシャル面に入る点が大きい。
NVIDIA ResearchのMOTIVEは、video modelのfine-tuningで動きを改善するclipを特定する手法だ。ICML 2026で評価され、base modelに対して74.1%のhuman preferenceを示した。
モデル評価中のセキュリティ事故をめぐり、HNでは侵害そのものよりも評価環境の設計に議論が集まった。危険な能力を測るテストは、もはや単なる実験ではない。