OpenAI, ChatGPT에서 o3 조용히 퇴역 — o3 Pro는 유지, API는 12월까지
OpenAI가 8월 26일 90일 일몰 기간 종료 후 ChatGPT에서 o3 모델을 퇴역시켰다. o3 Pro는 유료 구독자에게 계속 제공되며, API 접근은 2026년 12월 11일까지 유지된다. GPT-4.5도 같은 달 퇴역했다.
카테고리
Insights의 LLM 기사
OpenAI가 8월 26일 90일 일몰 기간 종료 후 ChatGPT에서 o3 모델을 퇴역시켰다. o3 Pro는 유료 구독자에게 계속 제공되며, API 접근은 2026년 12월 11일까지 유지된다. GPT-4.5도 같은 달 퇴역했다.
OpenAI가 8월 20일부터 GPT-5.6 등 프런티어 모델 API에 제로 데이터 보존 옵션을 제공한다. 세션 종료 후 사용자 입출력이 서버에 남지 않아, 의료·금융 등 규제 산업 기업 고객의 AI 채택 장벽을 낮추려는 조치다.
xAI의 최신 플래그십 모델 Grok 4.6이 Google Cloud Vertex AI에서 프리뷰로 이용 가능해졌다. 50만 토큰 컨텍스트와 $2/$6 가격으로 Google Cloud 생태계 개발자에게 제공된다.
실제 스프레드시트·문서를 다루는 독립 평가에서 Gemini 3.7 Flash가 60.0%를 기록해 Claude Opus 5의 53.8%를 6.2%포인트 앞섰다. 빠른 Flash 계열이 최고급 모델보다 반복 정확도에서 우위를 보이면서, 분석 에이전트의 비용·속도·신뢰성 조합을 다시 따져볼 근거가 생겼다.
모델 라우터가 왜 결제 회사에 중요한가. 931점을 받은 논의는 단순한 인수 소식보다 inference 사용량의 측정·청구·정산을 한 흐름으로 묶을 가능성을 파고들었다.
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
KV 캐시 전체를 HBM에 두지 않는 OasisKV가 장문 LLM 서빙의 메모리 병목을 겨냥했다. 요청당 KV 요구량을 6.5~9.7배 줄이면서 다중 GPU 처리량을 최대 2.1배 높였다.
지식 저장과 추론 연산을 분리한 Mobius가 7B Transformer와 비슷한 성능을 학습 데이터 62.6%로 달성했다. Qwen3.5-35B에서 이어 학습한 버전은 종단 간 추론 속도를 약 4배 높였다.
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
$60B 규모 Cursor 인수가 완료되면서 SpaceX는 AI 코딩 제품, 모델 개발 조직, 대규모 GPU 인프라를 한 회사 안에 묶었다. 이제 관전 포인트는 ‘더 강한 모델’보다 Cursor의 가격과 모델 선택권이 실제로 어떻게 달라지는가다.
Gemini 3.7 Flash가 Pro와 Ultra 두 유료 등급 전체에 배포됐다. Google은 수십 개 파일과 이메일의 관계를 찾아 하나의 문서로 만드는 다단계 작업의 추론 정확도를 높였다고 밝혔다.
NVIDIA NeMo Switchyard는 한 에이전트 흐름 안에서 작업 난도에 따라 모델을 바꾸는 오픈소스 프록시다. OpenAI·Anthropic 형식을 번역하고 Claude Code, Codex, OpenClaw 3종을 연결한다.