注目点はサンプルの見栄えだけではなく、生成と行動予測を同じmultimodal backboneに載せるという設計思想にある。
#multimodal
RSSフィードマルチモーダル推論モデルの公開競争に新しい有力候補が加わった。Thinking MachinesはInklingの全重みを公開し、64Kと256Kのコンテキスト、Tinkerでのfine-tuningを用意した。
HNで注目されたのは単なるbenchmark順位ではない。Thinking Machines LabのInklingは、multimodal MoE、調整可能なreasoning effort、Tinkerでのfine-tuningを組み合わせたopen-weight基盤として受け止められている。
MiniMax M3はベンチマーク投稿からオープンウェイト配布へ進んだ。モデルカードは約428Bパラメータ、23B有効パラメータ、1Mトークン文脈を示している。
議論の焦点は「encoder-free」が実際のモデル構造で何を意味するのかに集まった。
ローカルmultimodal AIの競争が12B級へ入った。Google GemmaはGemma 4 12BをApache 2.0で公開し、画像・音声・テキストを統合的に扱うencoder-free設計を示した。
Google I/O 2026の焦点は、Geminiを単独アプリではなく実行レイヤーとして広げることにある。Gemini 3.5 FlashはAPI、Antigravity、Android Studio、Search、Gemini appへ広がり、Gemini Omni Flashはvideo生成を同じ流れに乗せる。
Google DeepMindはGoogle I/O 2026にて、テキスト・画像・音声・動画などあらゆる入力から動画を生成するGemini Omniを発表した。GeminiのインテリジェンスとGoogleのメディア生成システムを統合し、GeminiアプリやYouTube Shortsで即日利用可能だ。
ByteDance Researchが、画像・動画の生成・編集・理解を単一モデルで処理するLance(3Bパラメータ)をApache 2.0ライセンスで公開した。主要ベンチマークでは7B以上のモデルに匹敵する性能を発揮している。
GoogleがGemini APIのファイル検索ツールをアップデートし、画像・音声・動画を含むマルチモーダルコンテンツ対応のRAGシステム構築が可能になった。
NVIDIAが4月28日に30BパラメータのマルチモーダルオープンモデルNemotron 3 Nano Omniを公開。視覚・音声・言語を単一モデルで処理し、同クラスオープンモデルより9倍高いスループットを実現。
IBM ResearchがタンパクMolecule・遺伝子データを統合するマルチモーダル生物学モデルMAMMALを発表。生物学ベンチマーク11項目中9項目で最高性能を達成し、一部でAlphaFold 3を上回った。