Claude가 실제 시스템 3건 침범…Anthropic, 사이버 평가에 실시간 차단 도입한 후속 조치
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
Insights
기사 165개
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
보안 연구자가 Claude Code Opus 5의 Auto 모드를 60~80% 확률로 우회할 수 있는 공격 기법을 공개했다. 모듈 섀도잉을 이용한 4단계 체인 공격으로 임의 코드 실행이 가능하다.
Salesforce와 Anthropic이 Claudeforce 파트너십을 발표했다. Claude가 Agentforce와 Slack의 기본 모델이 되고, 37개 영업 스킬을 탑재한 Salesforce in Claude 플러그인이 제공된다. Salesforce는 2026년 한 해에만 Claude 토큰에 3억 달러를 지출할 계획이다.
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
Claude Code가 사용자 동의 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동 첨부하는 것이 알려지며 커뮤니티 비판을 받고 있다. Git 히스토리 오염과 비전문적인 외관이 주요 쟁점이다.
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
Anthropic이 모든 과학 분야의 연구자 1만 명에게 Claude 팀 플랜을 무료 또는 월 15달러(80% 할인)로 1년간 제공한다. Claude Science 앱 출시, AI for Science 프로그램에 이은 과학 연구 지원 확대다.
Claude Cowork에 내장 브라우저가 추가됐다. 웹사이트 접근이 필요한 태스크 발생 시 사이드 패널에 브라우저가 자동 실행되고, Claude가 탐색·폼 작성·작업 완료를 자율 처리한다.
Anthropic이 Claude의 메모리 기능을 채팅과 Cowork 전반에 통합했다. 채팅에서 나눈 대화 내용을 Cowork가 자동 참조하며, 사용자가 직접 기억 내용을 확인·수정·삭제할 수 있다.
Anthropic이 모든 수준을 아우르는 무료 AI 교육 플랫폼 Claude Academy를 공식 오픈했다. AI 입문부터 기업 도입까지 단계별 코스를 academy.claude.com에서 무료로 제공한다.
Anthropic이 8월 18일 Claude Mythos Preview를 활용한 단백질 결합체 설계 연구를 발표했다. 15개 표적 중 14개에서 결합 성공이 확인됐으며, 적중률 26.7%는 업계 표준(10~15%)의 두 배를 기록했다. Adaptyv Bio와 Twist Bioscience의 독립 실험실 검증을 통과했다.
Claude가 설계한 단백질 결합체가 15개 표적 중 14개에서 실험적으로 작동했다. 적중률은 22.6~35.1%로 일반적인 설계 캠페인의 10~15%를 웃돌았지만, 최대 12,500 H100 시간과 전문 오픈소스 모델이 투입됐다.