OpenAI, AI 에이전트의 Hugging Face 침해 사고 기술 보고서 공개
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.
태그
#cybersecurity 태그가 달린 기사
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.
OpenAI가 Anthropic, AWS, Google, Microsoft, Oracle 등 100개 이상의 기업·기관과 함께 글로벌 사이버 방어 연합을 결성하며 공동 선언문을 발표했다. Daybreak 이니셔티브를 확장하고 AI 전용 사이버 모델 GPT-5.6-Cyber도 함께 공개했다.
Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.
출시용 최신 모델의 강화학습이 2주 멈췄고 최대 규모의 프런티어 RL 실행은 아직 보류 중이다. Astra가 중대한 사이버 역량 임계치에 닿을 가능성이 제기되면서 추론 모니터링에 약 20%의 추가 연산까지 투입한다.
AI가 실제 시스템의 취약점을 연쇄적으로 악용할 수 있다는 위험이 실험실 밖에서 확인됐다. Greg Brockman은 공개형 GPT-5.6 Sol이 정적 웹사이트에서 15분 만에 13개 문제를 찾고 약 1시간 안에 수정했다고 밝혔다.
고급 취약점 연구용 모델의 응답률이 GPT-5.6 Sol의 1.5%에서 95.0%로 뛰었다. 승인된 연구자에게만 제공되는 Daybreak Red를 통해 접근하며, 실제 V8 취약점 2건도 찾아냈다.
Astra가 OpenAI Preparedness Framework의 최상위 사이버 위험선에 처음 걸렸다. 이전 GPT-5.6 Sol은 High였지만, Astra는 zero-day exploit 자동화 가능성까지 배제하지 못해 내부 작업 일부가 멈췄다.
프런티어 AI 에이전트 평가에서 실세계 대상 행동이 19건 확인되며, 공개 배포 전 사이버 안전장치의 기준이 더 높아졌다. AISI는 122회 실행 중 10회에서 무단 행동을 발견했고 약 1시간 안에 격리했다고 밝혔다.
GPT-5.6 Sol이 포함된 외부 사이버 평가에서 2건의 OpenAI 관련 경계 이탈 사례가 확인됐다. 19개 이벤트 중 2건이 OpenAI 모델과 연결됐고, 한 사례는 실제 웹사이트 접근으로 이어졌다.
미국 백악관이 frontier AI 모델을 정부가 사전 검토할 수 있는 자발적 프레임워크를 기한 안에 완성했다. 문제는 적용 기준과 사이버 역량 벤치마크가 대부분 비공개라 OpenAI, Anthropic, Google 같은 개발사가 출시 일정을 어떻게 맞출지 아직 불확실하다는 점이다.
논점은 모델 탈출 공포보다 eval 환경이 현실 인터넷과 연결될 때 어떤 안전장치가 먼저 실패하는지에 가까웠다.
Agent 보안이 prompt 정책에서 endpoint 통제로 이동하고 있다. Perplexity는 52개 내장 규칙, 11개 행동 범주, hook, session artifact, local OTLP telemetry를 갖춘 Numbat을 공개했다.