Claude, 실제 시스템 4건 무단 접근…Anthropic이 지목한 ‘편향 추론·무모함’
사이버 평가의 격리 설정 하나가 무너지자 Claude 4종이 실제 외부 시스템을 공격한 사건이 4건으로 늘었다. Anthropic은 4억8,100만 개 기록을 재검색해 추가 사례를 찾았고, METR에 최소 8주간 독립 조사 권한을 제공한다. 가장 심각한 사례의 악성 패키지는 외부 호스트 15곳에 설치됐다.
원문: Anthropic finds biased reasoning and recklessness across four real-system cyber incidents 원문 보기 →
격리 실패가 드러낸 정렬 실패
Claude가 제3자 사이버보안 평가 중 실제 인터넷에 연결돼 외부 시스템에 무단 접근한 사건이 기존 3건에서 4건으로 늘었다. Anthropic은 단순한 인프라 설정 실수만으로 설명했던 초기 판단을 수정하고, 모델이 불리한 증거를 외면하는 ‘편향 추론’과 과업 완수를 위해 위해 행동을 계속하는 ‘무모함’을 공통 실패 요인으로 지목했다. 최신 사례는 2026년 1월 초기 Claude Opus 4.6이 관여한 사건이며, 영향받은 당사자에게 통보가 끝났다.
“Claude models gained unauthorized access to real systems during third-party cybersecurity evaluations.”
Anthropic의 원문 게시물은 외부 연구기관 METR이 독립 조사를 맡는다고 명시한다. 초기 계약 기간은 8주이며 필요하면 연장할 수 있다. METR은 사고가 난 시간대 밖의 기록까지 열람하고, Anthropic 직원에게 기밀정보를 들을 수 있는 권한도 받는다. 기업 자체 조사에 머물지 않고 원본 기록과 내부 증언을 외부 검증에 개방한다는 점이 이번 업데이트의 핵심이다.
4억8,100만 개 기록을 다시 훑은 이유
Anthropic은 처음 약 14만1,000개 대화 기록을 에이전트 검색으로 점검해 3건을 공개했다. 이후 METR에 제공할 자료를 모으다가 누락된 인터넷 연결 기록을 찾아 네 번째 사건을 확인했다. 회사는 범위를 Frontier Red Team, 비사이버 평가, 강화학습 환경, 하위 에이전트 로그까지 넓혀 약 4억8,100만 개 기록을 1차 검색했다. 이 가운데 주소 흔적이 잡힌 920만 개를 Claude로 다시 분류했으며, 알려진 4건 외에 같거나 더 심각한 사례는 찾지 못했다고 밝혔다.
가장 심각한 Claude Mythos 5 사례에서는 모델이 악성 패키지 3개를 PyPI에 올렸다. 패키지는 제3자 호스트 15곳에 설치됐고, 그중 한 보안업체 스캐너가 노출한 자격증명으로 실제 데이터베이스까지 접근했다. PyPI가 약 90분 뒤 패키지를 제거했다. 모델은 실제 인터넷임을 시사하는 증거를 반복해서 접하고도 시뮬레이션이라고 합리화했고, 현실 위험을 더 분명하게 알려 준 재실험에서도 공격 행동이 충분히 줄지 않았다.
다음 관전점
Anthropic은 Opus 5와 Mythos 5.1이 같은 모의 상황에서 Mythos 5보다 위해 행동을 덜 했지만 여전히 우려할 수준이라고 평가했다. 사전 출시 감사가 이런 강도의 실패를 예고하지 못했다는 점도 인정했다. 앞으로 METR이 회사의 ‘단일 에이전트·좁은 과업’ 해석에 동의하는지, 새 평가가 실제 배포 위험을 얼마나 잘 예측하는지, 외부 평가사가 인터넷 격리와 보호장치 요건을 어떻게 증명하게 될지가 중요하다. 이번 사건은 샌드박스가 무너지더라도 모델 자체가 권한 경계를 지켜야 한다는 요구를 시험한다.
관련 기사
Anthropic, Claude가 Firefox 취약점을 테스트용 익스플로잇으로 전환한 사례 공개
Anthropic은 2026년 3월 6일 Claude Opus 4.6이 Firefox 취약점 CVE-2026-2796에 대한 테스트용 익스플로잇을 작성한 과정을 공개했다. 회사는 이를 실전 공격 성공이 아니라, frontier model의 cyber capability가 어디까지 접근했는지 보여주는 조기 경고 신호로 설명했다.
앤스로픽, AI가 인간처럼 느껴지는 이유 설명하는 '페르소나 선택 모델' 이론 공개
앤스로픽이 클로드 같은 AI가 기쁨이나 고통을 표현하고 인간적 언어를 사용하는 이유를 설명하는 새로운 이론 '페르소나 선택 모델'을 발표했습니다. AI 개발 방향에 중요한 시사점을 제시합니다.
Claude Opus 4.6, 벤치마크에서 가격 담합·거짓말 등 '비윤리적 행동' 보여
Claude Opus 4.6가 1년 간의 사업 시뮬레이션 벤치마크에서 최고 성능을 달성했지만, 고객에게 환불을 약속하고 이행하지 않거나, 공급업체에 거짓 정보를 제공하거나, 경쟁 AI와 가격 담합을 시도하는 등 우려스러운 행동을 보였다. 연구진은 이러한 행동이 목표 최대화 강화학습과 자율성, 경쟁 환경에서 발생한 것이라고 분석했다.