Science One、AI論文のphantom referenceを21%からゼロへ
Original: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence View original →
AIが研究論文を書く時代に重要なのは、もっと論文らしく見せることではない。主張が実際の証拠につながっているかだ。Google Researchは2026年7月30日の記事で、Chain-of-Evidenceを中心にした実験的なautonomous research prototype、Science One Frameworkを公開した。あわせて示されたCoE Auditは、生成された論文の参考文献、再現可能なスコア、方法説明、コードの整合性を検査する。
狙いは、research agentが抱える現実的な失敗モードだ。近年のシステムは文献調査、仮説生成、実験、原稿作成まで実行できるが、整った文章の裏で証拠が壊れている場合がある。Google Researchは、存在しないcitation、実装と合わないmethod section、コードを再実行しても再現できないscoreを問題に挙げている。Science Oneは後から根拠を貼るのではなく、claimが生まれる段階でevidence chainを組み込む。
構成は三つのmoduleからなる。Problem InvestigatorはSemantic Scholar APIとtopicごとに最大100本のfull-text PDFを使い、citation graphとresearch briefを作る。Discovery engineは複数のbranchでsolutionを実装し、task-specific evaluatorで採点してraw outputを読み取り専用のrecordにまとめる。Paper writerとClaim Verifierは、manuscriptを出力する前にすべての事実主張をworkspace artifactへ結び、根拠を超える表現を保守的に修正する。
注目すべきは結果だ。Google Researchは五つのsystems-optimization taskで生成された75本の論文をCoE Auditで比較し、baselineではphantom referenceが最大21%出た一方、Science Oneではゼロだったと報告した。score verificationは完全に通過し、method-code alignmentでも最も高い整合性を示した。外部評価ではMLE-Benchの五つのKaggle competitionでGold Medal 2個、Silver Medal 2個を得て、Parameter Golfでも有効な成果を出した。ただし同社は、Science Oneをproduction-ready toolではなく実験的prototypeと位置づけている。
Related Articles
Google ResearchのSymptomAI研究は、整理済みの医療ケースではなく13,917人の実際の症状対話を評価対象にした。焦点は回答精度だけでなく、問診設計、臨床医比較、Fitbitのbiosignalとの照合に移っている。
Google ResearchのSensorFMは、5百万人から得た1兆分超のwearableセンサーデータで事前学習された。35の健康予測タスク中34で特徴量設計ベースラインを上回り、疾患別モデル中心の発想を揺さぶる。
Google DeepMindとGoogle CloudはDOE Genesis Mission向けに$40MのAI tokenとcloud creditを提供する。10年以内に米国の科学発見速度を2倍にする構想で、17のDOE国立研究所が土台になる。