Astra, OpenAI 첫 Critical 사이버 모델로 분류… 내부 작업 일시 중단과 통제 강화
Astra가 OpenAI Preparedness Framework의 최상위 사이버 위험선에 처음 걸렸다. 이전 GPT-5.6 Sol은 High였지만, Astra는 zero-day exploit 자동화 가능성까지 배제하지 못해 내부 작업 일부가 멈췄다.
원문: Astra hits OpenAI first Critical cyber threshold and pauses work 원문 보기 →
Astra가 넘어선 사이버 위험선
OpenAI가 차기 모델 Astra를 자체 Preparedness Framework에서 첫 번째 Critical 사이버 모델로 취급하기 시작했다. 단순한 안전 고지보다 무게가 큰 이유는 이전 모델인 GPT-5.6 Sol이 High 단계였던 반면, Astra는 더 높은 단계의 agentic coding 및 cybersecurity 성능을 보였다는 점이다.
OpenAI는 트윗에서 Astra를 첫 번째 "critical" cybersecurity 모델로 다룬다고 밝혔다.
해당 트윗은 2026년 8월 7일 게시됐고, FxTwitter 기준 조회수는 약 155만 회, 좋아요는 8,200건을 넘었다. OpenAI 공식 계정은 보통 제품 출시, 모델 접근성, 안전 정책 전환을 직접 알릴 때 사용되는데, 이번 글은 출시 홍보보다 내부 통제 변경을 전면에 세운 드문 사례다.
무엇이 Critical인가
OpenAI의 공식 설명에 따르면 Critical cybersecurity threshold는 모델이 hardened real-world critical systems에서 여러 심각도의 zero-day exploit을 사람 개입 없이 식별·개발하거나, 높은 수준의 목표만으로 복잡한 cyberattack 전략을 끝까지 설계·실행할 수 있는 경우를 가리킨다. 회사는 Astra의 preliminary evaluation과 전문가 평가를 합쳐 이 수준을 배제할 수 없다고 설명했다.
후속 조치도 구체적이다. OpenAI는 isolated testing environments, restricted network and tool access, model weight encryption, sandboxed execution, universal monitoring을 적용하고, 강화된 기준을 충족하지 못하는 Astra 관련 내부 활동을 일시 중단했다. 또한 정부 기관과 일부 AI safety organization에 외부 테스트를 맡길 계획이다.
다음 관전점
Astra는 아직 공개 모델이 아니며, OpenAI는 Hugging Face exploit과 관련이 없다고 선을 그었다. 앞으로 볼 지점은 두 가지다. 첫째, Critical 가능성이 실제 독립 평가에서도 유지되는지다. 둘째, 방어자에게 제공하겠다는 advanced cyber capability가 어떤 접근 제한과 감사 체계 안에서 배포되는지다. 원문 트윗은 여기에서 확인할 수 있다.
관련 기사
OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
GPT-6 Astra, Pro·Enterprise·API 전면 개방과 불투명 추론 논란
OpenAI가 9월 4일 GPT-6 Astra를 ChatGPT Pro, Enterprise, Business Premium 전 사용자와 API에 공개했다. 컴퓨터 사용·소프트웨어 엔지니어링 최고 성능을 주장하지만 추론 과정을 외부에서 관찰하기 어려운 '불투명 재귀' 방식을 도입해 안전성 우려도 제기됐다.
GPT-6 Astra 출시, ExploitBench 100%·SRE-Bench 99.2%로 컴퓨터 작업 전면화
컴퓨터에서 사람이 하던 작업을 끝까지 수행하는 GPT-6 Astra가 제한 배포를 시작했다. ExploitBench 100%, SRE-Bench 4회 시도 기준 99.2%를 기록해 생산성 향상과 사이버 위험이 동시에 커졌으며 API 가격은 입력 100만 토큰당 10달러다.