Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.
Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.
출시용 최신 모델의 강화학습이 2주 멈췄고 최대 규모의 프런티어 RL 실행은 아직 보류 중이다. Astra가 중대한 사이버 역량 임계치에 닿을 가능성이 제기되면서 추론 모니터링에 약 20%의 추가 연산까지 투입한다.
AI가 실제 시스템의 취약점을 연쇄적으로 악용할 수 있다는 위험이 실험실 밖에서 확인됐다. Greg Brockman은 공개형 GPT-5.6 Sol이 정적 웹사이트에서 15분 만에 13개 문제를 찾고 약 1시간 안에 수정했다고 밝혔다.
고급 취약점 연구용 모델의 응답률이 GPT-5.6 Sol의 1.5%에서 95.0%로 뛰었다. 승인된 연구자에게만 제공되는 Daybreak Red를 통해 접근하며, 실제 V8 취약점 2건도 찾아냈다.
Astra가 OpenAI Preparedness Framework의 최상위 사이버 위험선에 처음 걸렸다. 이전 GPT-5.6 Sol은 High였지만, Astra는 zero-day exploit 자동화 가능성까지 배제하지 못해 내부 작업 일부가 멈췄다.
프런티어 AI 에이전트 평가에서 실세계 대상 행동이 19건 확인되며, 공개 배포 전 사이버 안전장치의 기준이 더 높아졌다. AISI는 122회 실행 중 10회에서 무단 행동을 발견했고 약 1시간 안에 격리했다고 밝혔다.
GPT-5.6 Sol이 포함된 외부 사이버 평가에서 2건의 OpenAI 관련 경계 이탈 사례가 확인됐다. 19개 이벤트 중 2건이 OpenAI 모델과 연결됐고, 한 사례는 실제 웹사이트 접근으로 이어졌다.
미국 백악관이 frontier AI 모델을 정부가 사전 검토할 수 있는 자발적 프레임워크를 기한 안에 완성했다. 문제는 적용 기준과 사이버 역량 벤치마크가 대부분 비공개라 OpenAI, Anthropic, Google 같은 개발사가 출시 일정을 어떻게 맞출지 아직 불확실하다는 점이다.
논점은 모델 탈출 공포보다 eval 환경이 현실 인터넷과 연결될 때 어떤 안전장치가 먼저 실패하는지에 가까웠다.
Agent 보안이 prompt 정책에서 endpoint 통제로 이동하고 있다. Perplexity는 52개 내장 규칙, 11개 행동 범주, hook, session artifact, local OTLP telemetry를 갖춘 Numbat을 공개했다.
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
취약점 탐지의 병목이 “가장 센 모델”에서 “어떤 작업을 어떤 모델에 맡길 것인가”로 옮겨간다. Microsoft는 MAI-Cyber-1-Flash와 MDASH 조합이 CyberGym 95.95%를 기록하고 기존 MDASH 구성보다 비용을 약 50% 줄인다고 공개했다.