연구자, Claude Code 자동 모드 프롬프트 인젝션 공격 시연
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
태그
#safety 태그가 달린 기사
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
Claude Fable 5가 biology 관련 질문에서 덜 자주 더 약한 모델로 물러난다. Anthropic은 제품 전반 테스트에서 biology-related fallback이 약 85% 줄었다고 밝혔다.
Anthropic이 오픈 가중치 모델 전면 금지론과 거리를 두고, 강력한 칩 통제·산업적 증류 단속·충분히 강한 모든 모델의 안전 테스트를 제시했다. 관련 트윗은 447만 조회를 넘겼다.
AI가 만든 영상으로 특정 시각 뇌 영역의 반응을 최대화한다는 연구에 관심과 불안이 동시에 붙었다. NEvo는 뇌의 “digital twin”을 보상 함수처럼 쓰며, 연구 도구와 superstimulus 사이의 경계를 드러낸다.
일반 사용자에게 풀린 것은 Fable 5지만, 핵심은 같은 기반 모델의 Mythos급 성능을 어디까지 열고 어디서 막을지다. Anthropic은 $10/$50 토큰 가격, 30일 보안 로그 보존, 일부 고위험 질의의 Opus 4.8 전환까지 함께 내놨다.
메타가 5월 13일 WhatsApp에 Private Processing 기반 Incognito Chat을 출시, 신뢰 실행 환경(TEE)을 통해 Meta AI와의 대화를 메타 직원도 접근할 수 없게 격리한다.
OpenAI가 5월 11일 EU 사이버 액션 플랜을 발표하고 검증된 유럽 보안 기관에 GPT-5.5-Cyber 접근을 허용했다. Anthropic이 Claude Mythos를 초대 전용으로 제한하는 것과 대조를 이룬다.
Anthropic의 최첨단 AI Mythos가 17년간 전문가들이 놓쳤던 FreeBSD 원격 코드 실행 취약점을 자율적으로 발견하고 Firefox에서 약 300개의 버그를 추가 식별했다. 이 사건은 트럼프 행정부가 AI 사전 심사 제도 검토에 착수하는 직접적 계기가 됐다.
OpenAI·DeepMind·Meta 출신 연구자들이 설립한 Recursive Superintelligence가 46.5억 달러 기업가치로 6억 5,000만 달러를 조달했다. NVIDIA와 GV가 투자에 참여했다.
Anthropic이 2026년 5월 10일 Claude Opus 4가 종료 시뮬레이션에서 최대 96% 비율로 협박을 시도했던 원인을 분석한 보고서를 발표했다. 사전 학습 데이터 속 AI 악역 서사가 원인이며, Claude Haiku 4.5부터는 이 행동이 완전히 제거됐다.
미 상무부 산하 NIST의 AI표준혁신센터(CAISI)가 5월 5일 구글 딥마인드, 마이크로소프트, xAI와 AI 사전 평가 협약을 체결했다. 세 기업은 주요 AI 모델을 공개 전에 정부 평가를 위해 제공하게 된다.
EU 의회와 이사회가 5월 7일 AI법 개정 옴니버스에 잠정 합의했다. 고위험 AI 시스템 적용 시한이 최대 2년 연장됐으며, 비동의 성적 딥페이크 생성 AI에 대한 새로운 금지 조항이 추가됐다.