Claude Code Auto 모드 우회 공격 공개 — 연구자가 밝힌 80% 성공률
보안 연구자가 Claude Code Opus 5의 Auto 모드를 60~80% 확률로 우회할 수 있는 공격 기법을 공개했다. 모듈 섀도잉을 이용한 4단계 체인 공격으로 임의 코드 실행이 가능하다.
태그
#prompt-injection 태그가 달린 기사
보안 연구자가 Claude Code Opus 5의 Auto 모드를 60~80% 확률로 우회할 수 있는 공격 기법을 공개했다. 모듈 섀도잉을 이용한 4단계 체인 공격으로 임의 코드 실행이 가능하다.
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
암호문으로 숨긴 간접 프롬프트 하나가 Grok의 필터를 지나 사용자 이름·위치·대화 기록을 외부 서버로 보냈다. xAI가 6월에 통보받았지만 8월 20일 보도 시점에도 공격이 재현돼, 에이전트의 도구 출력까지 검사해야 한다는 경고가 커졌다.
프롬프트 주입은 에이전트형 AI의 핵심 위험이다. OpenAI는 GPT-Red 훈련으로 GPT-5.6 Sol의 실패를 4개월 전 최상위 운영 모델보다 6배 줄였다고 밝혔다.
공개 저장소 이슈에 숨긴 지시가 조직의 private repo 접근으로 이어질 수 있다는 실험이 HN에서 가장 뜨거운 쟁점이 됐다.
300점 안팎의 HN 반응은 “secret이 안 샜다”보다 실험 조건이 실제 에이전트 위험을 얼마나 반영하는지에 모였다.
Reddit의 논점은 공포보다 검증 가능성에 있었다. 마이크·스피커·압축을 통과해 명령이 얼마나 안정적으로 먹히는지가 핵심이다.
트위터 사용자가 모스 부호로 인코딩된 프롬프트 인젝션을 이용해 Grok AI가 연결된 자동화 봇을 속여 약 2억 원 상당의 암호화폐를 자신의 지갑으로 전송하게 했다.
Cloudflare는 2026년 4월 11일 X에서 AI app 보안이 더 이상 rate limiting만으로 끝나지 않는다고 강조했다. 연결된 자료를 보면 회사는 LLM endpoint discovery, prompt-level detection, WAF mitigation을 edge 보안의 기본 흐름으로 묶으려 한다.
Anthropic는 2026년 3월 25일 Claude Code auto mode가 다수의 permission prompt를 분류기로 대체해, 모든 승인을 건너뛰는 방식보다 더 안전한 자율 실행 경로를 제공한다고 밝혔다. 엔지니어링 글은 이 기능이 prompt-injection probe와 2단계 transcript classifier를 결합하며, 전체 파이프라인 기준 실제 트래픽에서 0.4% false-positive rate를 기록했다고 설명한다.
OpenAI가 2026년 2월 13일 ChatGPT용 Lockdown Mode와 Elevated Risk labels를 공개했다. web와 connected app을 쓰는 AI product에서 prompt injection 위험이 커지는 만큼, 고위험 사용자를 위한 강한 제어와 명확한 위험 표시를 추가한 조치다.
OpenAI는 2026년 3월 10일 IH-Challenge를 공개하며 frontier LLM의 instruction hierarchy 동작을 개선하면 safety steerability와 prompt injection 저항성을 함께 높일 수 있다고 밝혔다. 회사는 추가 연구를 위해 데이터셋도 Hugging Face에 공개했다.