GPT-5.6 Sol, 초당 750토큰·최대 14배 Ultrafast API 미리보기 시작
Original: GPT-5.6 Sol Ultrafast Hits 750 Tokens/s, Up to 14× Faster View original →
최상위 모델도 실시간 응답 영역으로
GPT-5.6 Sol이 표준 처리 대비 최대 14배 빠른 추론 경로를 얻었다. OpenAI가 공개한 Ultrafast 모드는 초당 최대 750개의 출력 토큰을 생성하며, 작은 모델로 바꾸지 않고도 음성 상담이나 장애 대응처럼 지연 시간에 민감한 작업을 겨냥한다. 우선 OpenAI API의 일부 고객에게 제한적으로 열리고, 처리 용량이 늘어나는 대로 대상이 확대된다.
“Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows.” — OpenAI
OpenAI는 모델·API·제품 출시와 배포 조건을 주로 전하는 공식 계정이다. 이번 게시물의 수치는 별도 제품 설명에서도 확인된다. Ultrafast는 Cerebras 인프라에서 GPT-5.6 Sol을 구동해 초당 최대 750개 출력 토큰을 내며, 표준 처리보다 최대 14배 빠르다. 속도를 위해 더 작거나 전문화된 모델을 선택하던 기존 절충을 줄이려는 서비스 계층이다.
속도가 바꾸는 적용 범위
회사는 초기 사용 사례로 실시간 음성·고객 지원, 상거래, 코딩과 디자인, 금융 조사, 보안 대응을 제시했다. 장애가 진행되는 동안 로그와 코드 변경을 분석하거나, 통화가 끊기기 전에 여러 시스템을 조회해 답을 만드는 작업은 총 응답 시간이 제품 품질을 좌우한다. 연구에서는 밤새 돌리던 반복 실험을 근무 시간 안의 대화형 순환으로 바꾸는 시나리오를 들었다.
초기 시험에는 Jane Street, Podium, Basis, Rogo가 참여했다. OpenAI 내부 개발자도 장애 대응에서 로그와 추적 정보, 대화를 빠르게 종합하고 다음 점검 항목과 수정안을 준비하는 데 이 모드를 사용했다. 배포 판단은 엔지니어가 맡는다는 조건도 분명히 했다. 금융 조사와 실시간 음성처럼 결과를 기다리는 동안 입력 환경이 계속 바뀌는 작업이 우선 검증 대상이다.
다만 이번 단계는 일반 출시가 아니라 제한된 미리보기다. 가격, 속도 보장 범위, 지역별 제공 일정과 표준 모드 대비 첫 토큰 지연 시간은 아직 공개되지 않았다. 초당 토큰 수가 높아도 네트워크 지연과 도구 호출 시간이 길면 전체 작업 속도는 달라질 수 있다.
다음으로 볼 지점은 용량 확대 속도와 실제 API 요금, 그리고 750토큰 수치가 긴 문맥·도구 사용·구조화 출력에서도 유지되는지다. 원문 게시물은 X에서 확인할 수 있고, 세부 설명은 OpenAI 제품 페이지에 담겼다.
Related Articles
GPT-5.6 Sol이 “The Last Ones” 사이버 레인지에서 새 최고 기록을 세우며, OpenAI는 이 성능을 Codex Security의 코드 취약점 탐지와 검증 흐름으로 연결했다. 보안팀 관점에서는 벤치마크 점수보다 실제 저장소에서 취약점을 찾고 고치는 시간이 핵심 숫자다.
Astra가 OpenAI Preparedness Framework의 최상위 사이버 위험선에 처음 걸렸다. 이전 GPT-5.6 Sol은 High였지만, Astra는 zero-day exploit 자동화 가능성까지 배제하지 못해 내부 작업 일부가 멈췄다.
고급 취약점 연구용 모델의 응답률이 GPT-5.6 Sol의 1.5%에서 95.0%로 뛰었다. 승인된 연구자에게만 제공되는 Daybreak Red를 통해 접근하며, 실제 V8 취약점 2건도 찾아냈다.