본문으로 건너뛰기

GPT-5.6 Sol, 초당 750토큰·최대 14배 Ultrafast API 미리보기 시작

Original: GPT-5.6 Sol Ultrafast Hits 750 Tokens/s, Up to 14× Faster View original →

Read in other languages: English日本語
LLM Aug 15, 2026 By Insights AI (Twitter) 1 min read Source

최상위 모델도 실시간 응답 영역으로

GPT-5.6 Sol이 표준 처리 대비 최대 14배 빠른 추론 경로를 얻었다. OpenAI가 공개한 Ultrafast 모드는 초당 최대 750개의 출력 토큰을 생성하며, 작은 모델로 바꾸지 않고도 음성 상담이나 장애 대응처럼 지연 시간에 민감한 작업을 겨냥한다. 우선 OpenAI API의 일부 고객에게 제한적으로 열리고, 처리 용량이 늘어나는 대로 대상이 확대된다.

“Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows.” — OpenAI

OpenAI는 모델·API·제품 출시와 배포 조건을 주로 전하는 공식 계정이다. 이번 게시물의 수치는 별도 제품 설명에서도 확인된다. Ultrafast는 Cerebras 인프라에서 GPT-5.6 Sol을 구동해 초당 최대 750개 출력 토큰을 내며, 표준 처리보다 최대 14배 빠르다. 속도를 위해 더 작거나 전문화된 모델을 선택하던 기존 절충을 줄이려는 서비스 계층이다.

속도가 바꾸는 적용 범위

회사는 초기 사용 사례로 실시간 음성·고객 지원, 상거래, 코딩과 디자인, 금융 조사, 보안 대응을 제시했다. 장애가 진행되는 동안 로그와 코드 변경을 분석하거나, 통화가 끊기기 전에 여러 시스템을 조회해 답을 만드는 작업은 총 응답 시간이 제품 품질을 좌우한다. 연구에서는 밤새 돌리던 반복 실험을 근무 시간 안의 대화형 순환으로 바꾸는 시나리오를 들었다.

초기 시험에는 Jane Street, Podium, Basis, Rogo가 참여했다. OpenAI 내부 개발자도 장애 대응에서 로그와 추적 정보, 대화를 빠르게 종합하고 다음 점검 항목과 수정안을 준비하는 데 이 모드를 사용했다. 배포 판단은 엔지니어가 맡는다는 조건도 분명히 했다. 금융 조사와 실시간 음성처럼 결과를 기다리는 동안 입력 환경이 계속 바뀌는 작업이 우선 검증 대상이다.

다만 이번 단계는 일반 출시가 아니라 제한된 미리보기다. 가격, 속도 보장 범위, 지역별 제공 일정과 표준 모드 대비 첫 토큰 지연 시간은 아직 공개되지 않았다. 초당 토큰 수가 높아도 네트워크 지연과 도구 호출 시간이 길면 전체 작업 속도는 달라질 수 있다.

다음으로 볼 지점은 용량 확대 속도와 실제 API 요금, 그리고 750토큰 수치가 긴 문맥·도구 사용·구조화 출력에서도 유지되는지다. 원문 게시물은 X에서 확인할 수 있고, 세부 설명은 OpenAI 제품 페이지에 담겼다.

Share: Long

Related Articles