OpenAI가 내세운 핵심은 단순 성능 업데이트가 아니다. Terminal-Bench 2.0 82.7%, SWE-Bench Pro 58.6%와 함께 GPT-5.4급 지연을 유지한다고 밝히며, 길고 지저분한 작업을 맡기는 코딩 에이전트 경쟁의 기준을 다시 올렸다.
#openai
RSS 피드OpenAI가 의료 현장용 워크스페이스를 무료로 풀었다. 미국 의사 AI 사용률이 72%까지 올라온 시점에 맞춰, 검증된 의사·NP·PA·약사에게 개방하고 6,924개 대화 평가에서 응답 99.6%를 안전·정확으로 제시했다.
개인정보 필터링은 이제 보안 옵션이 아니라 AI 파이프라인의 기본 인프라다. OpenAI의 1.5B 오픈웨이트 Privacy Filter는 128,000토큰을 로컬에서 처리하고, 보정된 PII-Masking-300k에서 F1 97.43%를 제시했다.
OpenAI가 이번엔 가장 불편한 질문에 현상금을 걸었다. GPT-5.5 Bio Bug Bounty는 Codex Desktop의 GPT-5.5를 상대로 바이오 안전 질문 5개를 한 번에 무너뜨리는 범용 탈옥 프롬프트에 $25,000을 내걸고, 정식 테스트를 4월 28일 시작한다.
이건 단순한 이용자 숫자 기사가 아니라 유통 전략 기사에 가깝다. OpenAI는 4월 초 주간 개발자 300만명 이상이던 Codex가 2주 만에 400만명을 넘겼고, 이 수요를 Codex Labs와 7개 GSI 파트너 체제로 받아내겠다고 했다.
병목이 GPU에서 API 계층으로 옮겨가자 OpenAI는 전송 방식을 손봤다. Responses API에 WebSocket 모드와 연결 범위 캐시를 넣으면서 agent workflow가 end-to-end 기준 최대 40% 빨라졌고, GPT-5.3-Codex-Spark는 1,000 TPS와 최대 4,000 TPS burst에 도달했다고 한다.
중요한 점은 OpenAI가 정확성 claim이 실제 clinical consequence로 이어지는 regulated workflow를 직접 겨냥한다는 데 있다. 연결된 rollout은 physician review 6,924 conversations와 99.6% safe/accurate rating을 제시했다.
중요한 점은 ChatGPT가 답변 도구에서 회사 workflow를 실제로 굴리는 공유 agent로 이동한다는 데 있다. research preview 대상은 Business, Enterprise, Edu, Teachers까지 4개 plan군이다.
OpenAI의 4월 21일 system card는 ChatGPT Images 2.0의 safety tradeoff를 숫자로 공개했다. Thinking mode에서 final blocking 전 policy-violating image 비율이 6.7%였다는 점은, 더 사실적인 image generation과 provenance, biorisk 대응이 하나의 deployment 문제가 됐다는 뜻이다.
HN의 관심은 demo reel이 아니라, 빽빽한 prompt를 얼마나 정확히 지키느냐에 쏠렸다. ChatGPT Images 2.0은 더 넓은 style과 multilingual text를 내세웠지만, 개발자들은 곧바로 hard prompt, text rendering, 가격, 학습 데이터 논쟁으로 끌고 갔다.
OpenAI는 Codex를 매주 300만 명이 넘는 developers가 쓰고 있다고 밝히며, desktop app을 code editor 밖으로 확장했다. 이번 update에는 macOS background computer use, in-app browser, gpt-image-1.5 image generation, 90개+ plugins, PR review workflow, SSH devboxes alpha, automations, memory preview가 포함됐다.
OpenAI가 GPT-Rosalind를 qualified life-science teams용 research preview로 열고, Codex에서 50개가 넘는 tools와 data sources를 연결하는 plugin을 붙였다. 핵심은 이름보다 성능 신호다. OpenAI는 Dyno Therapeutics의 RNA prediction task에서 best-of-ten 제출이 human experts의 95th percentile을 넘었다고 밝혔다.