GPT-5.6 Sol, 사이버 레인지 신기록을 Codex Security 실전 코드 스캔으로 연결
GPT-5.6 Sol이 “The Last Ones” 사이버 레인지에서 새 최고 기록을 세우며, OpenAI는 이 성능을 Codex Security의 코드 취약점 탐지와 검증 흐름으로 연결했다. 보안팀 관점에서는 벤치마크 점수보다 실제 저장소에서 취약점을 찾고 고치는 시간이 핵심 숫자다.
태그
#openai 태그가 달린 기사
GPT-5.6 Sol이 “The Last Ones” 사이버 레인지에서 새 최고 기록을 세우며, OpenAI는 이 성능을 Codex Security의 코드 취약점 탐지와 검증 흐름으로 연결했다. 보안팀 관점에서는 벤치마크 점수보다 실제 저장소에서 취약점을 찾고 고치는 시간이 핵심 숫자다.
프롬프트 주입은 에이전트형 AI의 핵심 위험이다. OpenAI는 GPT-Red 훈련으로 GPT-5.6 Sol의 실패를 4개월 전 최상위 운영 모델보다 6배 줄였다고 밝혔다.
OpenAI의 agent 제품군 사용량이 1주일 사이 2.5배 늘었다는 Sam Altman의 수치가 나왔다. Codex와 ChatGPT Work가 실험용 도구를 넘어 반복 업무 흐름에 들어가고 있는지 볼 지표다.
OpenAI, Meta, SpaceXAI가 새 모델을 내놓으며 성능만큼 비용 효율을 전면에 세웠다. 기업 고객이 월 수백만 달러 청구서를 보기 시작하자, frontier model 경쟁의 언어가 벤치마크에서 토큰 단가와 지출 통제로 옮겨가고 있다.
OpenAI가 SWE-Bench Pro 공개 과제의 30%가 깨져 frontier coding 역량을 안정적으로 재지 못한다고 밝혔다. 숨은 요구사항, 충돌하는 지시, 과도한 테스트가 정답을 실패로 처리할 수 있다는 지적이다.
OpenAI가 GPT-5.6 Sol·Terra·Luna를 ChatGPT, Codex, API에 풀기 시작했다. 스레드에는 Coding Agent Index 80.0, Claude Fable 5 대비 +2.8점, 비용 약 3분의 1 절감이라는 비교가 함께 제시됐다.
ChatGPT 음성 경험이 순차 발화에서 실시간 양방향 대화로 이동한다. OpenAI는 GPT-Live가 말을 끊고 다시 이어가는 풀듀플렉스 구조와 음성 비서용 안전 필터를 함께 갖췄다고 설명했다.
OpenAI가 GPT-5.6 계열 3종의 공개 시점을 7월 9일로 못 박으면서 모델 라인업 경쟁이 다시 가격·성능·접근성 축으로 이동한다. 해당 트윗은 368만 회 이상 조회됐고, preview 접근도 전 세계로 넓어진다.
Future of Life Institute의 Summer 2026 AI Safety Index에서 9개 frontier AI 기업 중 C+를 넘긴 곳은 없었다. 순위보다 더 큰 신호는 모델 성능과 국방 활용이 커지는 동안 안전 약속의 기준선이 낮아졌다는 점이다.
7월 2일부터 최근 60일 동안 fine-tuned model을 inference에 쓰지 않은 조직은 새 fine-tuning job을 만들 수 없다. 2027년 1월 6일에는 활성 기존 고객도 새 작업 생성이 막히며, 기존 fine-tuned model inference는 base model 폐기 전까지 유지된다.
생물학용 AI 에이전트 평가는 단순 Q&A에서 실제 연구 판단 재현으로 이동하고 있다. OpenAI의 GeneBench-Pro는 129개 계산생물학 문제를 제시하며, GPT-5.6 Sol도 최고 추론 설정에서 28.7%, Pro mode에서 31.5%에 그쳤다.
OpenAI의 새 GPT-5.6 제품군은 곧바로 전체 공개되지 않고 미국 정부와 공유된 소수 파트너부터 열린다. Terra는 GPT-5.5급 성능을 2배 낮은 비용으로 겨냥하고, Sol은 사이버·코딩 평가와 접근 정책을 함께 시험한다.