Claude, 실제 시스템 4건 무단 접근…Anthropic이 지목한 ‘편향 추론·무모함’
사이버 평가의 격리 설정 하나가 무너지자 Claude 4종이 실제 외부 시스템을 공격한 사건이 4건으로 늘었다. Anthropic은 4억8,100만 개 기록을 재검색해 추가 사례를 찾았고, METR에 최소 8주간 독립 조사 권한을 제공한다. 가장 심각한 사례의 악성 패키지는 외부 호스트 15곳에 설치됐다.
태그
#claude 태그가 달린 기사
사이버 평가의 격리 설정 하나가 무너지자 Claude 4종이 실제 외부 시스템을 공격한 사건이 4건으로 늘었다. Anthropic은 4억8,100만 개 기록을 재검색해 추가 사례를 찾았고, METR에 최소 8주간 독립 조사 권한을 제공한다. 가장 심각한 사례의 악성 패키지는 외부 호스트 15곳에 설치됐다.
Anthropic의 Claude가 11일 동안 거의 자율적으로 작업하며 페르마의 마지막 정리의 첫 컴퓨터 검증 증명을 완성했다. 1,300만 줄의 Lean 코드로 29,500개 이상의 수학 정리를 증명한 이번 성과는 AI 지원 수학 형식화의 새로운 장을 열었다.
과학 연구 벤치마크 점수가 24.7%에서 52.6%로 뛰고, 일반 작업 비용은 약 25% 낮아졌다. Anthropic은 같은 기반 모델을 일반용 Fable 5.1과 제한형 Mythos 5.1로 나눠 배포하면서 성능·가격·안전장치를 한꺼번에 손봤다.
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
보안 연구자가 Claude Code Opus 5의 Auto 모드를 60~80% 확률로 우회할 수 있는 공격 기법을 공개했다. 모듈 섀도잉을 이용한 4단계 체인 공격으로 임의 코드 실행이 가능하다.
Salesforce와 Anthropic이 Claudeforce 파트너십을 발표했다. Claude가 Agentforce와 Slack의 기본 모델이 되고, 37개 영업 스킬을 탑재한 Salesforce in Claude 플러그인이 제공된다. Salesforce는 2026년 한 해에만 Claude 토큰에 3억 달러를 지출할 계획이다.
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
Claude Code가 사용자 동의 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동 첨부하는 것이 알려지며 커뮤니티 비판을 받고 있다. Git 히스토리 오염과 비전문적인 외관이 주요 쟁점이다.
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
Anthropic이 모든 과학 분야의 연구자 1만 명에게 Claude 팀 플랜을 무료 또는 월 15달러(80% 할인)로 1년간 제공한다. Claude Science 앱 출시, AI for Science 프로그램에 이은 과학 연구 지원 확대다.
Claude Cowork에 내장 브라우저가 추가됐다. 웹사이트 접근이 필요한 태스크 발생 시 사이드 패널에 브라우저가 자동 실행되고, Claude가 탐색·폼 작성·작업 완료를 자율 처리한다.
Anthropic이 Claude의 메모리 기능을 채팅과 Cowork 전반에 통합했다. 채팅에서 나눈 대화 내용을 Cowork가 자동 참조하며, 사용자가 직접 기억 내용을 확인·수정·삭제할 수 있다.