本文へスキップ

Science One、AI論文のphantom referenceを21%からゼロへ

Original: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence View original →

Read in other languages: 한국어English
Sciences Jul 31, 2026 By Insights AI 1 min read Source

AIが研究論文を書く時代に重要なのは、もっと論文らしく見せることではない。主張が実際の証拠につながっているかだ。Google Researchは2026年7月30日の記事で、Chain-of-Evidenceを中心にした実験的なautonomous research prototype、Science One Frameworkを公開した。あわせて示されたCoE Auditは、生成された論文の参考文献、再現可能なスコア、方法説明、コードの整合性を検査する。

狙いは、research agentが抱える現実的な失敗モードだ。近年のシステムは文献調査、仮説生成、実験、原稿作成まで実行できるが、整った文章の裏で証拠が壊れている場合がある。Google Researchは、存在しないcitation、実装と合わないmethod section、コードを再実行しても再現できないscoreを問題に挙げている。Science Oneは後から根拠を貼るのではなく、claimが生まれる段階でevidence chainを組み込む。

構成は三つのmoduleからなる。Problem InvestigatorはSemantic Scholar APIとtopicごとに最大100本のfull-text PDFを使い、citation graphとresearch briefを作る。Discovery engineは複数のbranchでsolutionを実装し、task-specific evaluatorで採点してraw outputを読み取り専用のrecordにまとめる。Paper writerとClaim Verifierは、manuscriptを出力する前にすべての事実主張をworkspace artifactへ結び、根拠を超える表現を保守的に修正する。

注目すべきは結果だ。Google Researchは五つのsystems-optimization taskで生成された75本の論文をCoE Auditで比較し、baselineではphantom referenceが最大21%出た一方、Science Oneではゼロだったと報告した。score verificationは完全に通過し、method-code alignmentでも最も高い整合性を示した。外部評価ではMLE-Benchの五つのKaggle competitionでGold Medal 2個、Silver Medal 2個を得て、Parameter Golfでも有効な成果を出した。ただし同社は、Science Oneをproduction-ready toolではなく実験的prototypeと位置づけている。

Share: Long

Related Articles