Spatial-IQ、人間82.1%対モデル17.7%で空間推論の弱点を可視化
Original: Spatial-IQ exposes a 82.1% versus 17.7% gap in multimodal spatial reasoning View original →
空間推論のどこで崩れるかを見る
画像を見られることと、隠れた3D構造を人間のように数えられることは別問題だ。NVIDIA AIはXで、"Humans count the boxes in this image, hidden ones included, with 82.1% accuracy. The best off-the-shelf multimodal model manages 17.7%" と投稿した。出典は Xの投稿 で確認できる。
Spatial-IQはNVIDIA Researchによる診断型benchmarkだ。3D object countingを最終スコアだけで扱わず、列を数える、層を理解する、見えていないblockを物理的支持から推論する、といった9つの階層的な知覚・認知下位課題に分ける。project pageは、人間の空間認知がこの階層を組み合わせる一方で、現在のMLLMは中間推論が崩れたまま最終回答に進む可能性を問題にしている。
数字は差をはっきり示す。tweetによれば、人間は隠れた箱を含むcountingで82.1%のaccuracyを示したが、最良のoff-the-shelf multimodal modelは17.7%にとどまった。一方、Spatial-IQの下位課題で訓練したQwen2.5-VL-32Bは、object-counting accuracyが2.9%から62.6%へ上昇した。
NVIDIA AIのアカウントは、GPU、research stack、inference infrastructureに関わる成果を頻繁に伝える。次に見るべきなのは、他の研究者による再現だ。別のMLLM、video入力、robot manipulationで同じ階層診断が成り立つか、そしてbenchmark上の改善が実世界のscene understandingへ移るかが重要になる。
Related Articles
NVIDIAはCosmos 3 Nanoを交通安全動画QA向けに後処理し、精度を54.41%から93.35%へ引き上げた。LoRAとTAO AutoMLをagentが実行する流れが焦点だ。
NVIDIA ResearchのMOTIVEは、video modelのfine-tuningで動きを改善するclipを特定する手法だ。ICML 2026で評価され、base modelに対して74.1%のhuman preferenceを示した。
Safe SuperintelligenceはNVIDIAの投資とVera Rubinシステムへのアクセスにより、計算資源を一桁増やす。公開製品を持たない研究所が、最上位AIインフラの戦略顧客になった。