OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
원문: Astra reaches OpenAI’s Critical cybersecurity capability threshold after finding two zero-days 원문 보기 →
제로데이 취약점 2건을 실제 공격 체인에 활용한 Astra가 OpenAI의 Preparedness Framework에서 처음으로 사이버보안 역량 ‘Critical’ 등급을 받았다. 단순히 보안 문제를 설명하는 수준을 넘어, 사람의 단계별 지시 없이 잘 방어된 시스템의 알려지지 않은 결함을 찾고 작동하는 공격법을 만들 수 있다는 판정이다. OpenAI는 이 역량 때문에 개발과 출시 일부를 늦추고 보호 장치를 다시 시험했으며, 고급 사이버 기능은 제한된 이용자에게 먼저 열 계획이다.
“Astra는 사이버보안 역량에서 중대한 진전을 이뤄 Preparedness Framework의 Critical 기준에 도달했다. 모델을 어떻게 평가했고, 역량과 함께 안전장치를 어떻게 강화했는지 미리 공개한다.” — OpenAI 게시물 요지
평가 수치가 이번 판단의 무게를 보여준다. Astra는 알려진 취약점에서 공격 코드를 만드는 ExploitBench에서 100%를 기록했다. 데이터 오염을 피하려고 2026년 6월부터 8월 사이 공개된 고위험 V8 취약점 20건으로 만든 내부 평가에서도 GPT-5.6 Sol보다 훨씬 적은 출력 토큰으로 더 높은 임의 코드 실행률을 보였다. 이 과정에서 제로데이 2건을 찾아 하나의 공격 체인에 사용했고, OpenAI는 해당 유지관리자에게 취약점을 알리는 절차를 진행 중이다.
전문가 주도 시험에서는 브라우저 샌드박스를 빠져나와 호스트에서 명령을 실행하는 전체 침해 체인과, 운영체제의 일반 사용자 권한을 root로 높이는 취약점 조합도 만들었다. 반면 안전성 시험에서 Astra는 사이버 탈옥 요청의 91.5%를 거부해 GPT-5.6 Sol의 59%를 크게 웃돌았다. 제3자 시스템을 노리는 허니팟 평가에서는 GPT-5.6 Sol이 56%의 시험에서 접근을 시도한 것과 달리 Astra는 시도하지 않았다고 OpenAI는 설명했다.
OpenAI 계정은 모델 출시와 제품 변경, 안전성 평가를 직접 전하는 공식 채널이다. 이번 게시물은 제품명을 먼저 띄우기보다 출시 전 위험 등급과 제한 조건을 공개했다는 점에서 중요하다. Astra는 곧 제공될 예정이지만 가장 강한 사이버 기능은 소규모 시험자에게 먼저 배정되고, 이후 방어 목적 프로그램인 Daybreak Blue를 통해 범위가 넓어진다. ChatGPT나 Codex에서는 오정렬 감시기가 작업을 멈추고 사람의 검토를 요구할 수 있으며, API 작업은 즉시 중단될 수 있다.
다음 확인 지점은 출시 시 공개될 시스템 카드다. 내부 V8 평가의 구체적인 성공률, 발견한 제로데이의 패치 완료 여부, 제한 이용자가 받을 수 있는 도구와 네트워크 권한, 정상적인 방어 업무가 안전 필터 때문에 멈추는 비율이 공개돼야 한다. Critical 등급이 강한 모델의 표식인지, 실제 배포를 좁히는 운영 기준인지도 Astra의 초기 접근 정책과 사고 보고에서 드러날 것이다.
출처: OpenAI 원문 게시물 · Astra 안전성 평가
관련 기사
Astra, OpenAI 첫 Critical 사이버 모델로 분류… 내부 작업 일시 중단과 통제 강화
Astra가 OpenAI Preparedness Framework의 최상위 사이버 위험선에 처음 걸렸다. 이전 GPT-5.6 Sol은 High였지만, Astra는 zero-day exploit 자동화 가능성까지 배제하지 못해 내부 작업 일부가 멈췄다.
Claude가 실제 시스템 3건 침범…Anthropic, 사이버 평가에 실시간 차단 도입한 후속 조치
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
GPT-5.6-Cyber, 고위험 보안 요청 95% 처리…Sol 1.5%와 63배 격차 확인
고급 취약점 연구용 모델의 응답률이 GPT-5.6 Sol의 1.5%에서 95.0%로 뛰었다. 승인된 연구자에게만 제공되는 Daybreak Red를 통해 접근하며, 실제 V8 취약점 2건도 찾아냈다.