NVIDIA ResearchのSpatial-IQは、3D object countingを9つの下位課題に分解する診断benchmarkだ。人間の正答率82.1%に対し、最良の汎用multimodal modelは17.7%で、Qwen2.5-VL-32Bは訓練後2.9%から62.6%へ上がった。
#benchmark
RSSフィードGPT-5.6 Solは、reasoningを保持しcompactionを使うharnessではARC-AGI-3のスコアを13.3%から38.3%へ伸ばした。モデル比較では、重みだけでなくmemoryとcontext設計も読まなければならない。
AIインフラ競争は、GPU確保だけでなく学習throughputで測られている。NVIDIAはBlackwell UltraがDeepSeek-V3 671BでGPU当たり1,648 TFLOPs、前世代比約3倍を記録したとした。
AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。
長文書OCRの弱点は、ページ分割とKV cacheの膨張にある。BaiduのUnlimited-OCRは3B総パラメータ、500M有効パラメータ、32Kコンテキストで40ページ文書を一度に読むと紹介された。
NVIDIAはCosmos 3 Nanoを交通安全動画QA向けに後処理し、精度を54.41%から93.35%へ引き上げた。LoRAとTAO AutoMLをagentが実行する流れが焦点だ。
NVIDIA ResearchのMOTIVEは、video modelのfine-tuningで動きを改善するclipを特定する手法だ。ICML 2026で評価され、base modelに対して74.1%のhuman preferenceを示した。
注目点はスコア表だけではない。HNでは「シニアエンジニア」をbenchmarkでどう扱えるのかに議論が集まった。
LLM decodingを速くする別経路が出てきた。NVIDIAのNemotron-Labs-TwoTowerは30B backboneをtwo-tower diffusion modelへ変え、品質98.7%と2.42倍throughputを示した。
オープンweightモデルがIDOR検出でClaude Codeを超えた点に、コミュニティの関心が集まった。
Snyk VulnBench JS 1.0は、同じJavaScript脆弱性レビューを300回繰り返し、LLMの検出結果がどれだけ再現するかを測った。最良のLLM設定はSnyk-reference F1 75.4%で、unmatched findingの49.7%は5回中1回だけ出現した。
オープンウェイトのコーディングモデルが実用評価で一段上の水準に入った。Vals AIは、GLM 5.2がVibe Code Bench v1.1で64%を記録し、次のオープンモデルを14ポイント上回ったとしている。