본문으로 건너뛰기

GPT-6 Astra, FrontierMath 98%·ARC-AGI-3 99.9%로 추론 한계선 재설정

GPT-6 Astra가 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록하며 수학·추론·사이버 역량의 기준선을 동시에 끌어올렸다. 다만 OpenAI 자체 평가가 포함된 만큼 독립 재현과 실제 제품 환경의 안전성 검증이 다음 관문이다.

원문: GPT-6 Astra resets the frontier with 98% on FrontierMath and 99.9% on ARC-AGI-3 원문 보기 →

LLM X/Twitter 작성자 Insights AI (Twitter) 2분 소요 출처

세 벤치마크가 가리키는 성능 도약

수학 난제, 추상 추론, 취약점 공격 능력을 한 모델이 동시에 포화 수준까지 밀어붙였다는 점이 핵심이다. Sam Altman은 9월 3일 공개한 게시물에서 GPT-6 Astra가 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록했다고 밝혔다. 게시 시각은 2026년 9월 3일 19시 49분 UTC이며, 확인 시점에 조회수 342만 회와 좋아요 4만7천 건을 넘겼다.

“FrontierMath Tier 4 98%, ARC-AGI 3 99.9%, ExploitBench 100%.” — Sam Altman의 원문 게시물

이 수치 가운데 FrontierMath는 고난도 수학 문제 해결력을, ARC-AGI-3는 낯선 환경에서 규칙을 찾아 적응하는 능력을, ExploitBench는 알려진 소프트웨어 취약점을 실제 익스플로잇으로 전환하는 능력을 본다. 서로 성격이 다른 평가에서 동시에 상한에 접근했다는 것은 Astra가 단순한 대화 모델보다 컴퓨터를 직접 다루는 작업형 모델에 가깝게 설계됐음을 뜻한다.

공식 자료에서 확인되는 비교 수치

OpenAI의 기술 소개에 따르면 정밀 수치로는 FrontierMath Tier 4 v2가 97.6%로 이전 GPT-5.6 Sol의 83.0%를 앞섰다. ExploitBench는 100.0% 대 78.5%, ExploitGym은 42.4% 대 30.3%였다. 컴퓨터 사용 평가 OSWorld 2.0에서는 72.6%를 기록하면서 작업당 시간이 약 75분에서 40분으로 줄었다. 같은 자료는 Codex 하네스와 결합한 Mind2Web 작업 완료 속도가 GPT-5.6 Sol 환경보다 1.9배 빨라졌다고 설명한다.

사이버 성능은 장점이면서 배포 위험이다. OpenAI는 Astra가 평가 과정에서 알려지지 않은 제로데이 취약점 두 건을 찾아 활용했고, 유지관리자에게 공개 절차를 밟고 있다고 적었다. 출시 버전은 고급 공격용 개념증명 제작을 거부하도록 제한되며, 방어 조직에는 별도 프로그램으로 접근 범위를 넓힐 계획이다. 따라서 100%라는 숫자를 곧바로 일반 사용자가 모든 보안 작업을 자동화할 수 있다는 뜻으로 해석하면 안 된다.

배포 범위와 다음 확인점

Sam Altman 계정은 OpenAI의 모델 출시와 정책 방향을 직접 알리는 창구다. 이번 게시물도 제품 홍보 문구보다 세 가지 수치를 앞세웠지만, 최종 판단에는 독립 기관의 재실행이 필요하다. Astra는 일부 조직부터 시작해 ChatGPT Plus·Pro·Business·Enterprise, OpenAI API, Microsoft Azure, AWS Bedrock으로 순차 확대된다. API 표준 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다.

앞으로 볼 것은 세 가지다. 첫째, ARC-AGI-3와 FrontierMath 결과가 공개 조건에서 재현되는지, 둘째, 실제 브라우저와 운영체제 작업에서 47%의 시간 절감이 유지되는지, 셋째, 강화된 사이버 능력을 안전장치가 얼마나 안정적으로 제한하는지다. 벤치마크의 포화는 끝이 아니라 평가 방식 자체를 다시 설계해야 한다는 신호에 가깝다.

공유: 긴글

관련 기사

LLM X/Twitter

OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과

Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.

2분 소요 2 조회