GPT-5.6 Sol, ChatGPT·Codex·API 전면 배포와 80.0 coding agent 지표
Original: GPT-5.6 rolls into ChatGPT, Codex and API with 80.0 coding-agent score View original →
GPT-5.6 rollout shifts from preview to access
OpenAI의 GPT-5.6 라인이 예고 단계에서 실제 접근 단계로 넘어갔다. 핵심은 모델 이름 자체보다 배포면이다. OpenAI는 X에서 GPT-5.6 Sol, Terra, Luna가 ChatGPT, Codex, API에 들어가기 시작했다고 밝히며, 후속 글에서 Plus, Pro, Business, Enterprise 사용자가 중간 이상의 effort 설정으로 GPT-5.6 Sol을 쓰고 Pro와 Enterprise는 복잡한 작업용 GPT-5.6 Pro도 고를 수 있다고 설명했다.
"starting to roll out now in ChatGPT, Codex, and the API"
숫자도 같이 따라왔다. 같은 스레드에서 OpenAI는 Agents' Last Exam에서 GPT-5.6 Sol이 53.6점을 기록해 Claude Fable 5 adaptive보다 13.1점 앞섰다고 주장했다. 중간 reasoning 설정에서는 Fable 5보다 11.4점 높고 추정 비용은 약 4분의 1이라고 했다. Artificial Analysis Coding Agent Index에서는 80.0으로 Claude Fable 5보다 2.8점 높고, 출력 토큰과 소요 시간은 절반 미만, 비용은 약 3분의 1 낮다고 제시했다.
이 계정은 OpenAI의 공식 제품, 모델, 연구 채널이므로 이번 스레드는 단순 홍보 문구보다 제품 접근권과 벤치마크 포지셔닝을 동시에 보는 자료다. GPT-5.6은 ChatGPT의 대화형 사용, Codex의 agentic coding, API의 개발자 통합을 한 번에 겨냥한다. 특히 ultra mode와 병렬 agent 조율 언급은 긴 작업을 여러 agent가 나눠 처리하는 방향을 전면에 세운다.
다음 관전점은 외부 벤치마크의 재현성, 실제 API 가격표, 그리고 기업 계정에서 GPT-5.6 Pro가 어떤 작업에서 비용을 정당화하는지다. OpenAI가 제시한 80.0과 53.6이라는 숫자가 독립 평가에서도 유지된다면 coding agent 시장의 비교 기준이 다시 이동한다.
Related Articles
모델 성능 경쟁이 추론 비용 경쟁으로 옮겨가고 있다. OpenAI는 GPT-5.6 Sol을 배포 뒤 자체 최적화에 투입해 서빙 비용 20% 절감, 토큰 생성 효율 15% 이상 개선을 얻었다고 밝혔다.
OpenAI의 최신 가격 조정은 같은 예산으로 더 많은 호출을 처리하려는 개발팀에 직접적인 변수다. GPT-5.6 Luna는 80%, Terra는 20% 낮아졌고 Codex와 ChatGPT Work의 사용량 계산에도 반영된다.
OpenAI가 겨냥한 지점은 채팅이 아니라 장기 작업 자동화다. 공개 수치 기준으로 GPT-5.5는 Terminal-Bench 2.0에서 82.7%를 기록해 GPT-5.4보다 7.6%p 높았고, Codex에서는 더 적은 토큰으로 같은 일을 밀어붙인다고 적었다.