GPT-5.5-Cyber 85.6%, 보안 AI 경쟁의 초점이 취약점 발견에서 패치 자동화로 이동
취약점 탐지가 빨라진 뒤 남은 병목은 실제 패치다. OpenAI는 GPT-5.5-Cyber가 CyberGym에서 85.6%를 기록했고 Codex Security가 3만 개 이상 코드베이스를 스캔했다고 밝혔다.
원문: OpenAI Daybreak shifts cyber AI from finding bugs to landing fixes 원문 보기 →
취약점 발견보다 패치가 병목
AI 보안 경쟁의 초점이 취약점 탐지에서 검증, 증거 수집, 패치 작성으로 이동하고 있다. OpenAI의 6월 22일 트윗은 Daybreak를 Codex Security, GPT-5.5-Cyber, 파트너 프로그램, 오픈소스 지원 프로젝트로 확장한다는 내용이었다.
“find, validate, and fix vulnerabilities right inside Codex”
핵심 숫자는 모델 성능과 운영 규모다. OpenAI의 연결 문서에 따르면 GPT-5.5-Cyber는 CyberGym 단일 모델 평가에서 85.6%를 기록해 GPT-5.5의 81.8%를 앞섰다. ExploitGym에서는 39.5% 대 25.95%, SEC-bench Pro에서는 69.8% 대 63.1%로 비교됐다. Codex Security는 3만 개 이상 코드베이스와 3천만 개 이상 커밋을 스캔했고, 사람이 고쳤다고 표시한 발견 항목은 7만 건 이상, 자동으로 해결 상태가 확인된 항목은 50만 건 이상이라고 적었다.
OpenAI 계정은 주로 제품 출시, 연구, 정책성 메시지를 직접 올리는 공식 채널이다. 이번 글은 단순한 모델 성능표보다 개발 워크플로에 가깝다. Codex 안에서 깊은 스캔을 실행하고, 공격 경로를 추적하고, 위협 모델을 만들며, 코드베이스별 패치를 검토용으로 생성하는 흐름을 제시한다. 보안 파트너에게는 Trusted Access for Cyber를 통해 모델을 제품과 서비스에 넣도록 하는 구조도 함께 붙었다. 한국 독자에게 중요한 대목은 이 흐름이 보안팀만의 도구가 아니라 개발자 워크플로 안으로 들어온다는 점이다. 취약점 관리 시스템, SARIF 파일, CodeQL 쿼리 같은 기존 도구로 내보내는 경로가 붙으면, 모델 출력은 별도 실험이 아니라 감사 가능한 변경 제안으로 남는다. 다만 모델이 더 많은 후보를 만들수록 리뷰 부담과 책임 소재도 커진다. 따라서 성능 수치와 함께 변경 추적, 접근 권한, 검증 로그가 얼마나 촘촘한지도 같은 비중으로 봐야 한다.
오픈소스 쪽에서는 Patch the Planet이 별도 축이다. OpenAI는 Trail of Bits, HackerOne, Calif, 연구자, 유지관리자와 협력하고, cURL, Go, Python, Sigstore, pyca/cryptography 등 30개 이상 프로젝트가 초기 참여 의사를 냈다고 설명했다. 다음 관전점은 벤치마크 수치보다 실제 저장소에서 병합된 패치의 품질, 오탐 축소, 그리고 고위험 사이버 기능 접근 통제가 얼마나 투명하게 운영되는지다. Source tweet
관련 기사
GPT-5.6 Sol 제한 공개, cyber 안전장치와 $5 입력가의 의미
GPT-5.6은 단순한 모델 미리보기가 아니라 배포 절차 자체의 변화다. Sol은 Terminal-Bench 2.1 SOTA, ExploitBench에서 Mythos Preview 대비 약 1/3 출력 token이라는 수치를 내세우지만, 첫 접근권은 정부와 공유된 trusted partner로 제한된다.
OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
GPT-6 Astra 출시, ExploitBench 100%·SRE-Bench 99.2%로 컴퓨터 작업 전면화
컴퓨터에서 사람이 하던 작업을 끝까지 수행하는 GPT-6 Astra가 제한 배포를 시작했다. ExploitBench 100%, SRE-Bench 4회 시도 기준 99.2%를 기록해 생산성 향상과 사이버 위험이 동시에 커졌으며 API 가격은 입력 100만 토큰당 10달러다.