ChatGPT Work 해부: OpenAI가 에이전트 시대를 여는 방법
Simon Willison이 OpenAI의 ChatGPT Work를 상세 분석했다. 브라우저 자동화·서브에이전트·영구 스토리지를 갖춘 Work는 일반 ChatGPT와 차원이 다른 도구다.
태그
#gpt-5 태그가 달린 기사
Simon Willison이 OpenAI의 ChatGPT Work를 상세 분석했다. 브라우저 자동화·서브에이전트·영구 스토리지를 갖춘 Work는 일반 ChatGPT와 차원이 다른 도구다.
OpenAI가 8월 20일부터 GPT-5.6 등 프런티어 모델 API에 제로 데이터 보존 옵션을 제공한다. 세션 종료 후 사용자 입출력이 서버에 남지 않아, 의료·금융 등 규제 산업 기업 고객의 AI 채택 장벽을 낮추려는 조치다.
모델 안전성 검토가 손으로 만든 테스트를 넘어 출시 전 위험률 예측으로 이동하고 있다. OpenAI는 약 130만 건의 비식별 대화를 활용했고, GPT-5 계열에서 중앙값 1.5배 오차를 보고했다.
OpenAI가 GPT-5.5와 Codex를 기반으로 소프트웨어 취약점을 자동 탐지·패치하는 사이버 보안 플랫폼 Daybreak를 공개했다. Anthropic의 Claude Mythos에 맞서는 사이버 보안 AI 경쟁이 본격화됐다.
OpenAI가 GPT-5.5의 가격을 2배 인상했지만 모델의 응답 간결성 덕분에 실제 사용자 비용 증가는 49~92% 수준에 그쳤다는 OpenRouter의 분석이 나왔다.
OpenAI가 5월 7일 사이버보안 전문가 대상 특화 모델 GPT-5.5-Cyber의 제한 공개를 시작했다. Anthropic Mythos 접근 제한을 비판했던 OpenAI도 결국 같은 방식을 채택했다.
OpenAI가 GPT-5.5 Instant를 ChatGPT의 새 기본 모델로 출시했다. 의학·법률·금융 등 고위험 영역에서 환각 오류를 52.5% 줄이고 더 간결하면서 개인화된 응답을 제공한다. Gmail·과거 대화 맥락을 활용하는 개인화 기능이 Plus·Pro 사용자부터 순차 적용된다.
에이전트 벤치마크 FoodTruck Bench에서 DeepSeek V4 Pro가 GPT-5.2와 사실상 동등한 성능을 기록했다. GPT-5.2 테스트 대비 10주 만에, 비용은 약 17배 저렴하다.
AGI 수준 평가 벤치마크 ARC-AGI-3에서 GPT-5.5 High가 0.43%, Claude Opus 4.7이 0.18%를 기록했다. 최강 모델들도 이 벤치마크 앞에서는 사실상 제로에 수렴한다.
GPT-5.4 Pro가 에르되시 문제 1196을 풀기 위해 생성한 증명 방법이 60년 된 또 다른 에르되시 추측을 포함한 여러 문제에 성공적으로 적용됐다.
OpenAI는 2025-08-07에 GPT-5를 공개하며 ChatGPT와 API 동시 제공 전략을 발표했다. GPT-4o 대비 환각 45% 감소, HealthBench Hard 44.6 등 핵심 벤치마크 지표를 제시해 제품·개발자 양쪽에서의 전환 신호를 만들었다.
OpenAI는 2026년 1월 29일 공지를 통해 2월 13일부터 ChatGPT에서 GPT-4o와 구형 모델 선택을 종료한다고 밝혔다. GPT-4o는 GPT-5로, GPT-4.5는 GPT-5 thinking으로, o4-mini는 o5-mini로 대체된다.