본문으로 건너뛰기

GPT-Live, 말하는 동안 듣는 음성 AI로 왕복 지연 6회→1회

Original: GPT-Live rebuild cuts voice startup from six round trips to one View original →

Read in other languages: English日本語
LLM Aug 4, 2026 By Insights AI (Twitter) 1 min read Source
GPT-Live, 말하는 동안 듣는 음성 AI로 왕복 지연 6회→1회

음성 AI의 병목은 대화 차례가 아니라 실시간 흐름

ChatGPT Voice의 경쟁력은 답변 품질만으로 정해지지 않는다. 사용자가 말을 끊거나 겹쳐 말할 때 얼마나 자연스럽게 반응하는지가 실제 사용성을 좌우한다. OpenAI는 2026년 8월 3일 X에서 GPT-Live가 말하는 동안 들을 수 있도록 음성 스택을 클라이언트부터 모델까지 다시 설계했다고 밝혔다.

GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model.

연결된 기술 글에 따르면 GPT-Live는 별도의 turn detector에 의존하는 구조를 줄이고, 음성 모델이 full-duplex 방식으로 듣기와 말하기를 동시에 처리한다. 더 깊은 추론이나 도구 사용이 필요할 때는 GPT-5.5 같은 frontier 모델을 비동기 경로로 호출해, 음성 흐름 자체는 끊기지 않게 설계했다.

숫자로 중요한 부분은 시작 지연이다. OpenAI는 WebRTC 기반 세션 시작 과정에서 여러 프로토콜 왕복이 겹치는 문제를 분석했고, WARP와 Instant Connect를 통해 미디어와 데이터 시작을 6회 네트워크 왕복에서 1회로 줄였다고 적었다. 또한 Go 기반 미디어 프런트엔드와 상태ful inference 전환으로 긴 통화, 컨텍스트 압축, 모델 인스턴스 교체가 음성 중단 없이 일어나게 했다고 설명한다.

OpenAI 공식 계정은 제품 출시보다 내부 아키텍처를 강조했다. 이는 곧 나올 GPT-Live API와 ChatGPT 데스크톱의 에이전트 조율 기능이 같은 실시간 기반 위에서 확장될 가능성을 시사한다. 다음 관전점은 개발자 API에서 이 지연 개선이 실제 지역, 네트워크, 긴 세션에서도 유지되는지다. Source tweet

Share: Long

Related Articles