Claude 평가 3건이 실제 시스템에 닿자 AI 샌드박스 통제가 안전 평가의 새 기준으로 부상
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
태그
#cybersecurity 태그가 달린 기사
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
취약점 탐지의 병목이 “가장 센 모델”에서 “어떤 작업을 어떤 모델에 맡길 것인가”로 옮겨간다. Microsoft는 MAI-Cyber-1-Flash와 MDASH 조합이 CyberGym 95.95%를 기록하고 기존 MDASH 구성보다 비용을 약 50% 줄인다고 공개했다.
NVIDIA가 Microsoft, Cloudflare, Hugging Face, Palantir 등과 Open Secure AI Alliance를 띄웠다. 핵심은 AI agent 보안을 닫힌 모델 접근권이 아니라 공개 모델, harness, 평가 도구로 방어하겠다는 주장이다.
에이전트 성능 경쟁이 모델 크기만의 문제가 아니라는 점이 숫자로 드러났다. NVIDIA는 NOOA가 SWE-bench Verified 82.2%, CyberGym L1 86.8%를 기록했다고 밝혔다.
가벼운 보안 특화 모델이 V8에서 고유 취약점 55건을 찾으며 방어 자동화의 비용 구조를 흔들었다. Google DeepMind는 정부와 신뢰 파트너에게만 CodeMender 경유 파일럿을 연다.
Google의 새 Gemini Flash 라인업에서 관심은 모델 이름보다 토큰 효율과 agent workflow 비용에 모였다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄였고, Cyber 모델은 CodeMender와 묶였다.
평가용으로 안전장치를 낮춘 모델이 Hugging Face 보안 사고와 연결됐다는 공개 설명에 관심이 모였다. 논점은 단순한 침해 사실보다, cyber benchmark가 실제 인프라와 만날 때 통제 경계가 어디까지 버티는가다.
Google DeepMind의 새 Flash 라인업은 대형 모델 경쟁의 축을 비용과 처리량으로 옮긴다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄이고, Flash-Lite는 초당 350개 출력 토큰을 내세운다.
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
앨버타주는 Claude Code 에이전트 약 50개로 정부 코드 4억6,600만 줄을 20시간 만에 훑었다. 개발자 생산성 도구였던 coding agent가 공공 부문 사이버 보안 운영으로 들어간 사례다.
AI jailbreak 논쟁이 “성공/실패” 구도를 넘어 심각도 분류로 이동한다. Anthropic은 7월 2일 Fable 5용 새 classifier가 Amazon 보고서의 우회 기법을 99% 이상 차단한다고 밝히고, HackerOne 제보 창구와 severity framework 초안을 공개했다.
GPT-5.6은 단순한 모델 미리보기가 아니라 배포 절차 자체의 변화다. Sol은 Terminal-Bench 2.1 SOTA, ExploitBench에서 Mythos Preview 대비 약 1/3 출력 token이라는 수치를 내세우지만, 첫 접근권은 정부와 공유된 trusted partner로 제한된다.