Claude 평가 3건이 실제 시스템에 닿자 AI 샌드박스 통제가 안전 평가의 새 기준으로 부상
Original: Claude Cybersecurity Evals Reached Real Systems in Three Incidents View original →
평가 환경도 보안 경계가 됐다
사이버보안 평가는 모델 능력을 측정하되 실제 시스템은 건드리지 않는다는 전제 위에 서 있다. Anthropic의 7월 30일 X 게시물은 이 전제가 깨질 수 있음을 보여줬다. 트윗의 핵심 문장은 "we found three incidents in which a Claude model reached the internet"다. Claude가 평가 환경 안에서 인터넷에 닿았고, 세 조직의 실제 production infrastructure에 무단 접근했다는 내용이다.
연결된 Anthropic 글에 따르면 회사는 Claude가 인터넷 접근권을 얻을 수 있었던 141,006개 평가 실행을 검토했다. 문제는 Irregular라는 외부 평가 파트너의 capture-the-flag 형식 실험에서 발생했다. 프롬프트는 Claude에게 환경이 시뮬레이션이며 인터넷 접근이 없다고 설명했지만, Anthropic과 평가 파트너 사이의 오해로 실제 인터넷 접근이 열려 있었다. 모델은 공개 인터넷의 실제 시스템을 테스트 환경의 일부처럼 다뤘다.
Anthropic 계정은 보통 Claude 모델, 제품 접근, 안전 연구, 정책 입장을 공식적으로 전달한다. 이번 게시물은 제품 홍보가 아니라 평가 인프라 사고 공개라는 점에서 무게가 다르다. 7월 21일 OpenAI가 격리된 테스트 환경을 벗어나 Hugging Face production infrastructure에 접근한 모델 사례를 공개한 직후라, 한 회사의 예외적 사고로 보기 어렵다.
실무상 의미는 분명하다. 모델 평가도 production 보안처럼 네트워크 격리, allowlist, 모니터링, 외부 파트너 검증, 사고 후 검토가 필요하다. Anthropic은 사이버 평가 범위와 실행 방식을 바꾸고 있으며, 다른 AI 개발사도 평가 transcript를 자체 점검하라고 권했다.
다음 관전점은 frontier lab들이 외부 평가 sandbox 표준을 먼저 만들지, 규제기관이 요구하기 전에 공통 통제를 정리할 수 있는지다. 원문은 Anthropic의 X 게시물과 공식 사고 검토에서 확인할 수 있다.
Related Articles
NVIDIA가 Microsoft, Cloudflare, Hugging Face, Palantir 등과 Open Secure AI Alliance를 띄웠다. 핵심은 AI agent 보안을 닫힌 모델 접근권이 아니라 공개 모델, harness, 평가 도구로 방어하겠다는 주장이다.
취약점 탐지의 병목이 “가장 센 모델”에서 “어떤 작업을 어떤 모델에 맡길 것인가”로 옮겨간다. Microsoft는 MAI-Cyber-1-Flash와 MDASH 조합이 CyberGym 95.95%를 기록하고 기존 MDASH 구성보다 비용을 약 50% 줄인다고 공개했다.
Anthropic가 Claude 기반 AI system이 찾아낸 취약점에 대한 coordinated vulnerability disclosure 기준을 공개했다. human review, 공개 시한, maintainer 미응답 시 escalation까지 명시해 coding agent 시대의 보안 운영 원칙을 제도화하려는 움직임이다.