과학
Science One, AI 논문 환각을 21%→0으로 줄인 증거 사슬 실험
AI 연구 agent의 약점은 논문처럼 보이는 결과물이 아니라 검증되지 않는 주장이다. Google Research는 Science One Framework가 baseline의 phantom reference 최대 21%를 0으로 줄이고 점수 검증까지 통과했다고 공개했다.
1분 소요 19 조회
태그
#research-agents 태그가 달린 기사
AI 연구 agent의 약점은 논문처럼 보이는 결과물이 아니라 검증되지 않는 주장이다. Google Research는 Science One Framework가 baseline의 phantom reference 최대 21%를 0으로 줄이고 점수 검증까지 통과했다고 공개했다.
AI가 alignment 연구 자체를 돕는 실험이 수치로 검증됐다. Anthropic은 Claude Opus 4.6 기반 연구 에이전트가 weak-to-strong supervision 문제에서 성능 격차의 97%를 회복했다고 밝혔다.