ChatGPT 음성 엔진 GPT-Live-1, 개발자에게 개방 — 분당 $0.05에 완전 이중 음성 에이전트 구축
OpenAI가 ChatGPT를 구동하는 완전 이중(full-duplex) 음성 모델 GPT-Live-1을 API로 공개했다. 분당 $0.05에 동시 청취·발화, 12개 신규 음성, 전화 지원 기능을 제공하며 개발자가 전화 에이전트·지원 시스템·튜터링 앱에 자연스러운 음성 대화를 직접 내장할 수 있다.
원문: OpenAI Opens GPT-Live-1 to Developers: Full-Duplex Voice at $0.05/min 원문 보기 →
개요
OpenAI가 9월 10일 GPT-Live-1을 API로 공개했다. 7월부터 ChatGPT 내부에서 운영되던 이 모델을 개발자가 직접 앱에 통합할 수 있게 됐다. GPT-Live-1은 한쪽이 말하는 동안 반대쪽이 침묵해야 하는 전통적 방식과 달리, 동시에 청취하고 발화하는 완전 이중(full-duplex) 방식으로 작동한다.
핵심 기능
- 완전 이중(Full-Duplex): 음성 생성 중에도 상대방의 말을 실시간으로 처리해 자연스러운 인터럽트와 방향 전환 대응 가능
- 12개 신규 음성: 다양한 톤과 억양의 선택지 확보
- 전화 지원(Telephony): 전화 인프라와 직접 연동 가능
- 키워드 바이어싱: 특정 단어 인식 정확도를 높이는 미세 조정 지원
- 백엔드 위임: 복잡한 추론은 GPT-6 Astra 같은 별도 모델에 위임하고 음성 레이어는 최소 지연 유지
가격과 아키텍처
음성 레이어만 분당 $0.05로 과금된다. 백엔드 모델의 토큰 비용과 에이전트 인프라 비용은 별도 청구된다. 전체 아키텍처는 음성 프론트엔드가 자연스러운 대화를 처리하고, 무거운 추론 작업은 별도 모델에 넘기는 분리 구조다.
활용 사례
전화 에이전트, 고객 지원, 튜터링, 예약 시스템 등이 주요 활용 사례다. 기존 Realtime API 대비 구현 코드가 대폭 줄고, 개발자가 음성 에이전트를 구축하는 진입 장벽이 크게 낮아진다는 평가가 나온다.
관련 기사
GPT‑Live‑1 API, 끼어들기 80% 줄이고 음성 코드 2만3000줄 걷어낸 구조 전환
듣기와 말하기를 한 모델에서 동시에 처리해 기존 STT–LLM–TTS 연결부를 줄였다. 초기 평가에서 학습자 대화 끼어들기는 약 80% 감소했고, 한 의료 서비스는 음성 코드 2만3000줄을 없앴다.
OpenAI, GPT-5급 음성 추론 모델 GPT-Realtime-2 API 공개
OpenAI가 GPT-5급 추론 능력을 갖춘 실시간 음성 모델 GPT-Realtime-2를 API에 공개했다. 실시간 번역 모델 GPT-Realtime-Translate, 스트리밍 전사 모델 GPT-Realtime-Whisper도 함께 출시됐다.
Codex 에이전트 인프라를 단일 API로 — OpenAI Agents API 퍼블릭 베타 공개
OpenAI가 Codex를 구동하는 에이전트 인프라를 단일 API로 개방했다. Agents API 퍼블릭 베타에서는 태스크·모델·도구·실행 환경만 지정하면 OpenAI가 세션 오케스트레이션, 컨텍스트 관리, 복구를 처리한다. API 자체의 추가 요금은 없으며 9개 컴퓨트 파트너와 연동된다.