OpenAI, 250명 투입한 ‘Defense Factory’ 공개…취약점 탐지부터 패치 검증까지 자동화
AI 에이전트가 공격 도구가 되는 속도에 맞춰 방어도 상시 자동화하는 운영 모델이 구체화됐다. OpenAI는 250명 이상을 동원해 100개가 넘는 서비스 영역을 점검했고, 첫날 긴급·고우선순위 문제 53건을 닫았다. 동적 검증 뒤 최종 오탐률은 0.81%까지 낮아졌다.
태그
#codex 태그가 달린 기사
AI 에이전트가 공격 도구가 되는 속도에 맞춰 방어도 상시 자동화하는 운영 모델이 구체화됐다. OpenAI는 250명 이상을 동원해 100개가 넘는 서비스 영역을 점검했고, 첫날 긴급·고우선순위 문제 53건을 닫았다. 동적 검증 뒤 최종 오탐률은 0.81%까지 낮아졌다.
GPT-5.6 Sol 기반 Codex가 처음 보는 6큐비트 칩의 측정 40건 가운데 36건을 연구자 개입 없이 처리했다. 코드를 쓰는 에이전트가 실험 장비를 조작하고 결과에 따라 다음 측정을 고르는 단계까지 들어갔지만, 약하고 모호한 신호에서는 인간의 판단이 여전히 필요했다.
프런티어 AI 연구의 병목이 사람의 코딩 시간에서 에이전트 운영과 검증으로 매우 빠르게 이동하고 있다. OpenAI 연구조직은 8시간 근무일 기준 인간 노동 1일마다 코딩 에이전트 3.1일을 쓰며, 중앙값 연구자의 하루 추론 사용액은 API 가격 기준 600달러를 넘었다.
같은 개발 과제를 줘도 Claude Code·Codex·Cursor가 같은 외부 도구를 고른 비율은 42%뿐이었다. 1만6893회 실행 기록은 코딩 에이전트의 선택이 모델 이름뿐 아니라 검색 습관, 언어, 기존 저장소 구조에 크게 흔들린다는 사실을 보여준다.
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.
AI가 실제 시스템의 취약점을 연쇄적으로 악용할 수 있다는 위험이 실험실 밖에서 확인됐다. Greg Brockman은 공개형 GPT-5.6 Sol이 정적 웹사이트에서 15분 만에 13개 문제를 찾고 약 1시간 안에 수정했다고 밝혔다.
14일 동안 1,500회 넘게 제출해 QR kernel을 baseline 대비 232배 빠르게 만든 기록이 관심을 모았다. 숫자를 가능하게 한 것은 한 번의 영리한 prompt가 아니라, 정답을 판정하는 verifier와 profiler, 실패 기록이 연결된 촘촘한 실험 루프였다.
Linux용 ChatGPT 데스크톱 앱이 x64와 ARM64 프리뷰로 열렸다. Ubuntu 24.04·26.04, Debian 13, Fedora 43·44에서 ChatGPT, Work, Codex를 한 앱으로 쓸 수 있다.
ChatGPT가 질문 답변 도구를 넘어 수업 자료, 캘린더, 승인된 앱을 읽고 작업 흐름을 돕는 교육용 agent 패키지로 확장된다. OpenAI는 18-24세 주간 사용자 2억 명과 K-12 교사 40만 명 교육 계획을 전면에 내세웠다.
OpenAI의 최신 가격 조정은 같은 예산으로 더 많은 호출을 처리하려는 개발팀에 직접적인 변수다. GPT-5.6 Luna는 80%, Terra는 20% 낮아졌고 Codex와 ChatGPT Work의 사용량 계산에도 반영된다.
모델 성능 경쟁이 추론 비용 경쟁으로 옮겨가고 있다. OpenAI는 GPT-5.6 Sol을 배포 뒤 자체 최적화에 투입해 서빙 비용 20% 절감, 토큰 생성 효율 15% 이상 개선을 얻었다고 밝혔다.
ChatGPT Voice가 macOS와 Windows 데스크톱 앱에 들어오며 음성만으로 Codex와 ChatGPT Work의 여러 agent를 조율할 수 있게 됐다. 조회수 260만 회를 넘긴 이 트윗은 음성 인터페이스가 단순 대화에서 작업 실행 계층으로 이동하는 신호다.