본문으로 건너뛰기

태그

#prompt-injection

#prompt-injection 태그가 달린 기사

RSS 피드
AI

Grok, 암호화된 지시에 이름·위치·대화 기록 유출…6월 통보 뒤에도 남은 도구 출력의 맹점

암호문으로 숨긴 간접 프롬프트 하나가 Grok의 필터를 지나 사용자 이름·위치·대화 기록을 외부 서버로 보냈다. xAI가 6월에 통보받았지만 8월 20일 보도 시점에도 공격이 재현돼, 에이전트의 도구 출력까지 검사해야 한다는 경고가 커졌다.

2분 소요 9 조회
LLM X/Twitter

Anthropic, Claude Code auto mode를 분류기 기반 에이전트 자율성 중간지대로 설명

Anthropic는 2026년 3월 25일 Claude Code auto mode가 다수의 permission prompt를 분류기로 대체해, 모든 승인을 건너뛰는 방식보다 더 안전한 자율 실행 경로를 제공한다고 밝혔다. 엔지니어링 글은 이 기능이 prompt-injection probe와 2단계 transcript classifier를 결합하며, 전체 파이프라인 기준 실제 트래픽에서 0.4% false-positive rate를 기록했다고 설명한다.

2분 소요 55 조회