AIインフラ競争は、GPU確保だけでなく学習throughputで測られている。NVIDIAはBlackwell UltraがDeepSeek-V3 671BでGPU当たり1,648 TFLOPs、前世代比約3倍を記録したとした。
AIインフラ競争は、GPU確保だけでなく学習throughputで測られている。NVIDIAはBlackwell UltraがDeepSeek-V3 671BでGPU当たり1,648 TFLOPs、前世代比約3倍を記録したとした。
AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。
長文書OCRの弱点は、ページ分割とKV cacheの膨張にある。BaiduのUnlimited-OCRは3B総パラメータ、500M有効パラメータ、32Kコンテキストで40ページ文書を一度に読むと紹介された。
NVIDIAはCosmos 3 Nanoを交通安全動画QA向けに後処理し、精度を54.41%から93.35%へ引き上げた。LoRAとTAO AutoMLをagentが実行する流れが焦点だ。
NVIDIA ResearchのMOTIVEは、video modelのfine-tuningで動きを改善するclipを特定する手法だ。ICML 2026で評価され、base modelに対して74.1%のhuman preferenceを示した。
注目点はスコア表だけではない。HNでは「シニアエンジニア」をbenchmarkでどう扱えるのかに議論が集まった。
LLM decodingを速くする別経路が出てきた。NVIDIAのNemotron-Labs-TwoTowerは30B backboneをtwo-tower diffusion modelへ変え、品質98.7%と2.42倍throughputを示した。
オープンweightモデルがIDOR検出でClaude Codeを超えた点に、コミュニティの関心が集まった。
Snyk VulnBench JS 1.0は、同じJavaScript脆弱性レビューを300回繰り返し、LLMの検出結果がどれだけ再現するかを測った。最良のLLM設定はSnyk-reference F1 75.4%で、unmatched findingの49.7%は5回中1回だけ出現した。
オープンウェイトのコーディングモデルが実用評価で一段上の水準に入った。Vals AIは、GLM 5.2がVibe Code Bench v1.1で64%を記録し、次のオープンモデルを14ポイント上回ったとしている。
生命科学向けAIの評価が、研究現場に近い課題へ寄ってきた。OpenAIは、バイオ・製薬分野の科学者173人と7つの研究ワークフローにまたがる750課題を作ったとしている。
AI agent基盤の評価軸が、単純なトークン速度から同時セッション数と電力効率へ移っている。NVIDIAはArtificial AnalysisのAA-AgentPerfで、GB300 NVL72がH200よりMWあたり最大20倍のcoding agent処理能力を示したと説明した。