본문으로 건너뛰기
腐食中

Google DeepMind、AGI進捗を測るcognitive frameworkを提案

Original: Measuring progress toward AGI: A cognitive framework View original →

Read in other languages: English
AI Mar 19, 2026 By Insights AI 1 min read 32 views Source
This article is not available in your selected language. Showing the original version.

Google DeepMindは2026年3月17日、AGIへの進捗をどのように測るべきかについての新しい論文を公開し、現在のAGI議論には持続的なempirical frameworkが欠けていると主張した。この発表は、AGIが近いとか、単一のbenchmarkで結論を出せると宣言するものではない。そうではなく、cognitive scienceを土台にAI systemの能力をより体系的に記述し、比較する評価層を作ろうという提案だ。DeepMindはこれを、frontier modelの能力主張と本格的な一般知能評価の間をつなぐ測定インフラの問題として捉えている。

論文は、一般知能に重要だと考える10のcognitive abilityを挙げている。perception、generation、attention、learning、memory、reasoning、metacognition、executive functions、problem solving、social cognitionである。さらに三段階の評価プロトコルを提案する。第一に、各能力をカバーする広い課題群でAI systemを評価し、held-out setでcontaminationを抑える。第二に、同じ課題について人口統計的に代表性のある成人サンプルからhuman baselineを集める。第三に、モデルの成績を単純なraw scoreではなく、人間の成績分布に対する相対的位置として解釈する。

この考え方を実務に落とし込むために、DeepMindはKaggleと共同でhackathonも始めた。評価の空白が大きいlearning、metacognition、attention、executive functions、social cognitionの五つの領域で、communityに新しいevaluation設計を促すものだ。参加者はKaggle Community Benchmarks platform上でbenchmarkを構築し、frontier model lineupに対して試験できる。Googleによれば、賞金総額は20万ドルで、応募期間は3月17日から4月16日、結果発表は6月1日だという。

重要性

  • benchmark設計は、lab、investor、regulatorがfrontier modelの進歩をどう読むかを左右する基準になっている。
  • DeepMindは単一スコアのleaderboardよりhuman-relative measurementを重視している。
  • Kaggle hackathonによって、抽象的なframeworkがcommunityベースのevaluation構築へ接続された。

今回の発表はAGI達成を宣言するものではない。むしろ大手研究所が、今後の進捗主張をどう評価し、どう比較すべきかという基準そのものを標準化しようとしている動きといえる。このframeworkが広く採用されれば、将来のモデル比較の仕方、capability gapの議論、AGIをめぐる公共的な議論がよりevidence-drivenになる可能性がある。

Share: Long

Related Articles

AI X/Twitter Mar 26, 2026 2 min read

Google DeepMind는 2026년 3월 26일 대화형 AI가 감정을 악용하거나 사람을 해로운 선택으로 유도할 수 있는지를 다룬 새 연구를 공개했다. 회사는 영국·미국·인도 참가자 1만 명 이상이 참여한 9개 연구를 바탕으로, harmful AI manipulation을 측정하는 첫 empirically validated toolkit을 만들었다고 밝혔다.

AI Reddit Mar 3, 2026 1 min read

Google DeepMind의 AI 수학 연구 에이전트 Aletheia가 FirstProof Challenge에서 전문가 심사단이 인정한 연구 수준 수학 문제 10개 중 6개를 자율적으로 해결했습니다. Gemini Deep Think 기반의 이 에이전트는 테렌스 타오 등 수학자들로부터 가치 있는 연구 협력자로 인정받고 있습니다.