Claude가 11일 만에 완성한 페르마의 마지막 정리 형식 증명
Anthropic의 Claude가 11일 동안 거의 자율적으로 작업하며 페르마의 마지막 정리의 첫 컴퓨터 검증 증명을 완성했다. 1,300만 줄의 Lean 코드로 29,500개 이상의 수학 정리를 증명한 이번 성과는 AI 지원 수학 형식화의 새로운 장을 열었다.
태그
#mathematics 태그가 달린 기사
Anthropic의 Claude가 11일 동안 거의 자율적으로 작업하며 페르마의 마지막 정리의 첫 컴퓨터 검증 증명을 완성했다. 1,300만 줄의 Lean 코드로 29,500개 이상의 수학 정리를 증명한 이번 성과는 AI 지원 수학 형식화의 새로운 장을 열었다.
미해결 난제 자체를 풀지는 못했지만, Claude는 리만 가설을 만족하는 제타 함수 영점의 알려진 하한을 41.6%에서 67.2%로 높였다. 3,100만 출력 토큰과 약 60개 하위 에이전트를 동원한 결과다.
Astra가 만든 수학 결과 10건 가운데 주목도가 높았던 2건에서 2016년과 2019년 선행 연구의 핵심 아이디어가 제대로 드러나지 않았다는 지적이 나왔다. OpenAI는 ‘최소 10년간 진전이 없었다’는 문구를 고쳤고 논문도 보완하겠다고 밝혔다.
AI가 수학 연구의 비용 구조를 바꾸고 있다. OpenAI는 내부 Astra 모델이 약 $2,000 상당의 GPT-5.6 Sol 토큰으로 10개 난제 결과를 만들고 Lean 인증서까지 냈다고 밝혔다.
OpenAI가 미공개 모델 Astra로 수학·이론컴퓨터과학의 장기 미해결 문제 10건에 대한 새 결과를 냈다. 각 논증은 사람이 논문 형태로 정리한 뒤 Lean certificate로 형식 검증됐고, 탐색 비용은 Sol API 요금 기준 약 $2,000로 제시됐다.
OpenAI의 차기 모델 계열 Astra가 수학·이론컴퓨터과학의 장기 미해결 문제 10개에서 새 결과를 냈다. OpenAI는 전체 해법 탐색의 토큰 비용을 Sol API 기준 약 $2,000로 제시했고, 각 결과를 Lean 증명서와 함께 공개했다.
OpenAI의 범용 추론 모델이 에르되시의 평면 단위거리 문제 추측 상한을 반증하는 반례를 찾아냈다고 발표했습니다. 수학자들이 증명을 검토했지만 ML 커뮤니티는 방법론 투명성에 의문을 제기합니다.
OpenAI의 범용 추론 모델이 수학자 폴 에르되시가 1946년에 제시한 기하학 난제를 자율적으로 해결했다. AI가 수학의 주요 미해결 문제를 스스로 풀어낸 최초의 사례로, 외부 수학자들이 증명을 검토하고 검증했다.
OpenAI의 범용 추론 모델이 1946년 폴 에르되시가 제기한 이산 기하학의 핵심 추측을 자율적으로 반증했다. AI가 수학의 주요 미해결 문제를 독립적으로 해결한 것은 역사상 처음이며, 다수의 수학자들이 독립적으로 검증했다.
구글 딥마인드가 제미나이 기반 멀티 에이전트 시스템 'AI 수학 공동 연구자'를 공개해 FrontierMath Tier 4에서 모든 AI 중 최고인 48%를 기록했다. AlphaEvolve는 11~20년간 유지된 램지 수(Ramsey number) 5개의 하한선 갱신에 성공했다.
필즈상 수상 수학자 Timothy Gowers가 ChatGPT 5.5 Pro로 미해결 수학 문제에 도전해 약 1시간 만에 박사급 증명을 이끌어냈다. 수학 연구의 위기가 임박했다고 경고했다.
GPT-5.4 Pro가 에르되시 문제 1196을 풀기 위해 생성한 증명 방법이 60년 된 또 다른 에르되시 추측을 포함한 여러 문제에 성공적으로 적용됐다.