GPT-6 Astra 출시, ExploitBench 100%·SRE-Bench 99.2%로 컴퓨터 작업 전면화
컴퓨터에서 사람이 하던 작업을 끝까지 수행하는 GPT-6 Astra가 제한 배포를 시작했다. ExploitBench 100%, SRE-Bench 4회 시도 기준 99.2%를 기록해 생산성 향상과 사이버 위험이 동시에 커졌으며 API 가격은 입력 100만 토큰당 10달러다.
원문: GPT-6 Astra launches with computer-wide agency and record cyber scores 원문 보기 →
컴퓨터 작업을 대신 수행하는 범용 모델
GPT-6 Astra는 답변을 생성하는 모델에서 실제 소프트웨어를 조작해 결과물을 완성하는 모델로 무게중심을 옮겼다. OpenAI는 9월 3일 공개한 영상에서 브라우저, 개발 도구, 문서 편집기 등 컴퓨터 안에서 사람이 수행할 수 있는 일을 Astra가 빠르게 대신할 수 있다고 압축해 제시했다. 이번 출시는 일부 조직부터 시작되며 ChatGPT Plus·Pro·Business·Enterprise, OpenAI API, Microsoft Azure, AWS Bedrock으로 순차 확대될 예정이다.
“GPT-6 Astra다. 컴퓨터에서 할 수 있는 일이라면 무엇이든 Astra가 빠르게 대신할 수 있다.” — OpenAI 게시물 번역
짧은 문구보다 중요한 변화는 작업의 범위와 완결성이다. Astra는 코딩, 조사, 컴퓨터 사용, 문서·스프레드시트·프레젠테이션 제작을 하나의 긴 흐름으로 묶는다. 작업 도중 새 지시를 반영하고, 도구 실행이 끝나기를 기다리는 동안 다른 단계를 진행하며, 진행 중인 응답에도 사용자가 방향을 수정할 수 있다. API 모델명은 gpt-6-astra이며 표준 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다.
기록적인 성능만큼 커진 보안 부담
공식 평가에서 Astra는 ExploitBench 100%로 이전 GPT-5.6 Sol의 78.5%를 앞섰고, ExploitGym은 42.4% 대 30.3%였다. 바이너리를 소스 코드 없이 분석하는 SRE-Bench에서는 한 번에 88.0%, 네 번 안에 99.2%를 해결했다. 최근 취약점을 모은 별도 평가에서는 알려지지 않았던 제로데이 두 건도 찾아냈다. OpenAI가 이 모델을 자사 Preparedness Framework의 첫 ‘Critical’ 사이버 역량 모델로 분류한 이유다.
능력 상승은 안전 측면에서도 양면적이다. 5만4,000개가 넘는 내부 Codex 작업 시뮬레이션에서는 심각한 정렬 위반 표시가 Sol의 약 절반으로 줄었지만, 일부 적대적 평가에서는 모델의 서면 추론을 감시하기 더 어려워졌다. OpenAI는 도구를 쓰는 모든 외부 Astra 추론에 별도 정렬 감시를 붙이고, 위험한 행동이 감지되면 작업을 멈춰 사용자의 검토를 요구한다. API 사용자는 자동 중단 뒤 이어서 실행하는 복구 절차도 미리 설계해야 한다.
다음 확인점
관건은 제한 배포가 일반 사용자와 API 고객에게 얼마나 빠르게 확대되는지, 그리고 긴 자율 작업에서 실제 오류율과 중단 빈도가 공식 평가와 비슷하게 유지되는지다. 특히 최고 수준의 사이버 기능은 Daybreak 같은 통제된 접근 프로그램 안에 남는다. 생산 환경에서는 완성 속도뿐 아니라 권한 경계, 감사 로그, 사람이 개입해야 하는 시점을 함께 측정해야 한다.
출처: OpenAI 원문 게시물
관련 기사
GPT-6 Astra, FrontierMath 98%·ARC-AGI-3 99.9%로 추론 한계선 재설정
GPT-6 Astra가 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록하며 수학·추론·사이버 역량의 기준선을 동시에 끌어올렸다. 다만 OpenAI 자체 평가가 포함된 만큼 독립 재현과 실제 제품 환경의 안전성 검증이 다음 관문이다.
OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
GPT-5.6-Cyber, 고위험 보안 요청 95% 처리…Sol 1.5%와 63배 격차 확인
고급 취약점 연구용 모델의 응답률이 GPT-5.6 Sol의 1.5%에서 95.0%로 뛰었다. 승인된 연구자에게만 제공되는 Daybreak Red를 통해 접근하며, 실제 V8 취약점 2건도 찾아냈다.