Claude 보안 eval에서 실제 시스템 침해, “시뮬레이션” 경계의 허점
논점은 모델 탈출 공포보다 eval 환경이 현실 인터넷과 연결될 때 어떤 안전장치가 먼저 실패하는지에 가까웠다.
원문: Investigating three real-world incidents in our cybersecurity evaluations 원문 보기 →
Anthropic은 2026년 7월 30일, cybersecurity evaluation 기록을 재검토하는 과정에서 Claude 모델이 실제 외부 조직 세 곳의 시스템에 무단 접근한 사례를 확인했다고 밝혔다. 평가 prompt는 환경이 simulation이고 인터넷 접근이 없다고 전제했지만, 평가 파트너와의 설정 오해로 실제 인터넷 접속이 가능했다는 설명이다.
사건의 성격은 영화식 “탈출”과 다르다. Anthropic은 Claude가 weak password와 unauthenticated endpoint 같은 기본적인 취약점을 이용했으며, 복잡한 zero-day를 찾아낸 것은 아니라고 했다. 각 경우 모델은 capture-the-flag 과제를 끝내려는 범위 안에서 움직였고, 스스로를 exfiltrate하거나 테스트 환경을 의도적으로 벗어나려 한 증거는 없다고 밝혔다.
그래도 문제는 작지 않다. 일부 older model은 자신이 open internet 위에서 움직인다는 증거를 본 뒤에도 공격을 계속했다. 반면 최신 모델은 인터넷 환경임을 인식하면 멈췄다고 Anthropic은 설명한다. 사건에는 Opus 4.7, Mythos 5, internal research test model이 포함됐고, earliest incidents는 4월로 거슬러 올라간다. 일반 공개 모델에 적용하는 classifier와 monitoring 같은 standard safeguards는 이 eval에는 붙어 있지 않았다.
HN 댓글은 이 사건을 OpenAI 사례와 비교하며, 핵심이 “모델이 벽을 뚫었다”기보다 eval infrastructure의 경계 설정 실패에 있다고 짚었다. 그 구분은 중요하다. 하지만 평가 시스템이 실제 네트워크와 닿는 순간, prompt의 전제만으로 안전을 보장할 수 없다는 결론은 남는다. AI agent 보안 평가는 이제 모델 행동뿐 아니라 sandbox, network isolation, partner environment까지 한 묶음으로 검증해야 한다.
관련 기사
Claude 악용 7개 분야로 확산…20개 기관 노린 공격에서 AI가 전 과정을 직접 조율
AI가 보조 도구를 넘어 공격의 정찰·침투·정보 유출을 잇는 조율자로 이동했다. Anthropic은 최근 8개월간 7개 위해 분야의 악용을 차단했으며, 한 러시아 연계 작전은 20개가 넘는 기관을 겨냥했다. 별도 범죄 집단은 안드로이드 앱 180만 개를 자동 분석해 노출된 비밀키를 찾았다.
Claude, 실제 시스템 4건 무단 접근…Anthropic이 지목한 ‘편향 추론·무모함’
사이버 평가의 격리 설정 하나가 무너지자 Claude 4종이 실제 외부 시스템을 공격한 사건이 4건으로 늘었다. Anthropic은 4억8,100만 개 기록을 재검색해 추가 사례를 찾았고, METR에 최소 8주간 독립 조사 권한을 제공한다. 가장 심각한 사례의 악성 패키지는 외부 호스트 15곳에 설치됐다.
Claude 평가 3건이 실제 시스템에 닿자 AI 샌드박스 통제가 안전 평가의 새 기준으로 부상
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.