r/singularityで注目された投稿は、OpenAIがSWE-bench Verifiedのテスト品質問題を理由に評価利用を停止した発表を共有した。少なくとも16.4%の欠陥指摘は、coding LLMベンチマークの読み方に直接影響する。
#evaluation
RSSフィードLLM Reddit Feb 27, 2026 1 min read
LLM Reddit Feb 25, 2026 1 min read
r/singularityで共有されたMETRの新しい生産性アップデートは、2025年の「AIで減速」結果を再検討し、現在は加速方向のシグナルが出ている可能性を示した。ただしMETR自身は強い選択バイアスにより推定の不確実性が高いと明示している。
AI Hacker News Feb 20, 2026 1 min read
Hacker Newsで注目された投稿は、同じ意味のポリシーでも言語が変わるだけでguardrail評価が36-53%ずれる可能性を示し、多言語安全性評価の不足を指摘した。
LLM Hacker News Feb 17, 2026 1 min read
Hacker Newsで注目されたSkillsBenchは、86タスク・11ドメインでAgent Skillの有効性を比較した。curated skillは平均通過率を押し上げた一方、モデルが自動生成したskillは平均的な改善を示さなかった。
Sciences Feb 16, 2026 1 min read
OpenAIは160超の政治学ジャーナルを対象に100万件超のsynthetic evaluationを実施し、再現研究の優先順位づけ手法を公開した。モデル予測と実測結果の不一致を、再検証価値の高い研究の発見に使う設計だ。
LLM Feb 15, 2026 1 min read
NISTのCAISIは、言語モデル向け自動ベンチマーク評価の草案 NIST AI 800-2 を公表し、2026年3月31日まで意見募集を実施している。草案は目的設定、実行手順、結果分析・報告の標準化を中心に構成される。
LLM Reddit Feb 14, 2026 1 min read
LocalLLaMAで共有されたSWE-rebench 1月結果は、Claude Code先行を維持しつつ上位差の縮小とオープンモデル追い上げを示した。