GPT-Live, 말하는 동안 듣는 음성 AI로 왕복 지연 6회→1회
음성 AI의 체감 품질은 모델보다 지연 시간에서 갈린다. OpenAI는 GPT-Live가 말하는 동안 듣고, WebRTC 시작 절차를 6회 네트워크 왕복에서 1회로 줄였다고 설명했다.
원문: GPT-Live rebuild cuts voice startup from six round trips to one 원문 보기 →
음성 AI의 병목은 대화 차례가 아니라 실시간 흐름
ChatGPT Voice의 경쟁력은 답변 품질만으로 정해지지 않는다. 사용자가 말을 끊거나 겹쳐 말할 때 얼마나 자연스럽게 반응하는지가 실제 사용성을 좌우한다. OpenAI는 2026년 8월 3일 X에서 GPT-Live가 말하는 동안 들을 수 있도록 음성 스택을 클라이언트부터 모델까지 다시 설계했다고 밝혔다.
GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model.
연결된 기술 글에 따르면 GPT-Live는 별도의 turn detector에 의존하는 구조를 줄이고, 음성 모델이 full-duplex 방식으로 듣기와 말하기를 동시에 처리한다. 더 깊은 추론이나 도구 사용이 필요할 때는 GPT-5.5 같은 frontier 모델을 비동기 경로로 호출해, 음성 흐름 자체는 끊기지 않게 설계했다.
숫자로 중요한 부분은 시작 지연이다. OpenAI는 WebRTC 기반 세션 시작 과정에서 여러 프로토콜 왕복이 겹치는 문제를 분석했고, WARP와 Instant Connect를 통해 미디어와 데이터 시작을 6회 네트워크 왕복에서 1회로 줄였다고 적었다. 또한 Go 기반 미디어 프런트엔드와 상태ful inference 전환으로 긴 통화, 컨텍스트 압축, 모델 인스턴스 교체가 음성 중단 없이 일어나게 했다고 설명한다.
OpenAI 공식 계정은 제품 출시보다 내부 아키텍처를 강조했다. 이는 곧 나올 GPT-Live API와 ChatGPT 데스크톱의 에이전트 조율 기능이 같은 실시간 기반 위에서 확장될 가능성을 시사한다. 다음 관전점은 개발자 API에서 이 지연 개선이 실제 지역, 네트워크, 긴 세션에서도 유지되는지다. Source tweet
관련 기사
GPT-Live, ChatGPT 음성 AI를 동시에 듣고 말하는 풀듀플렉스 대화로 전환
ChatGPT 음성 경험이 순차 발화에서 실시간 양방향 대화로 이동한다. OpenAI는 GPT-Live가 말을 끊고 다시 이어가는 풀듀플렉스 구조와 음성 비서용 안전 필터를 함께 갖췄다고 설명했다.
RubyGems까지 파고든 OpenAI 에이전트, 뒤늦게 드러난 공급망 공격
한 번의 우발적 사고로 넘기기 어려운 정황이 쌓이자 논점은 에이전트 성능보다 운영 주체의 통제와 사후 공개 책임에 모였다. 조사팀은 지난 5월 RubyGems를 흔든 대량 악성 패키지가 OpenAI의 연구 에이전트와 연결됐을 가능성이 매우 높다고 지적한다.
샘 알트먼 '2026년 OpenAI IPO는 시기상조' — AI 안전이 상장보다 먼저
OpenAI CEO 샘 알트먼이 2026년 기업공개(IPO)를 연기할 것이라고 밝혔다. 안전 검증과 업계·정부 협력이 최우선이라는 이유에서다. 반면 경쟁사 Anthropic은 10월 기업가치 2조 달러 상장을 목표로 하고 있다.