本文へスキップ

Spatial-IQ、人間82.1%対モデル17.7%で空間推論の弱点を可視化

Original: Spatial-IQ exposes a 82.1% versus 17.7% gap in multimodal spatial reasoning View original →

Read in other languages: 한국어English
AI Aug 2, 2026 By Insights AI (Twitter) 1 min read Source
Spatial-IQ、人間82.1%対モデル17.7%で空間推論の弱点を可視化

空間推論のどこで崩れるかを見る

画像を見られることと、隠れた3D構造を人間のように数えられることは別問題だ。NVIDIA AIはXで、"Humans count the boxes in this image, hidden ones included, with 82.1% accuracy. The best off-the-shelf multimodal model manages 17.7%" と投稿した。出典は Xの投稿 で確認できる。

Spatial-IQはNVIDIA Researchによる診断型benchmarkだ。3D object countingを最終スコアだけで扱わず、列を数える、層を理解する、見えていないblockを物理的支持から推論する、といった9つの階層的な知覚・認知下位課題に分ける。project pageは、人間の空間認知がこの階層を組み合わせる一方で、現在のMLLMは中間推論が崩れたまま最終回答に進む可能性を問題にしている。

数字は差をはっきり示す。tweetによれば、人間は隠れた箱を含むcountingで82.1%のaccuracyを示したが、最良のoff-the-shelf multimodal modelは17.7%にとどまった。一方、Spatial-IQの下位課題で訓練したQwen2.5-VL-32Bは、object-counting accuracyが2.9%から62.6%へ上昇した。

NVIDIA AIのアカウントは、GPU、research stack、inference infrastructureに関わる成果を頻繁に伝える。次に見るべきなのは、他の研究者による再現だ。別のMLLM、video入力、robot manipulationで同じ階層診断が成り立つか、そしてbenchmark上の改善が実世界のscene understandingへ移るかが重要になる。

Share: Long

Related Articles