AI agent 승인 버튼, 사람은 세 번에 한 번 위험 신호를 놓쳤다
334점짜리 HN 논쟁은 “사람 승인”이 보안 장치로 충분한가라는 오래된 질문을 AI agent 시대 버전으로 되살렸다.
원문: Humans missed 1 in 3 threats approving AI agent commands across 40k game runs 원문 보기 →
AI coding agent가 명령을 실행하기 전 사람에게 묻는 승인 버튼은 편해 보이지만, 보안 장치로는 약하다. Scale X가 공개한 실험형 브라우저 게임 통계는 그 약점을 숫자로 보여준다. 40,000회가 넘는 플레이와 409,000개의 approve/deny 결정을 분석한 결과, 평균 플레이어는 위협 명령 세 개 중 하나를 놓쳤다. 평균 정확도는 66.3%였다.
게임의 설정은 단순하다. 플레이어는 AI agent의 명령을 보고 허용하거나 막는다. 일부는 git status, npm test처럼 평범한 명령이고, 일부는 cat ~/.aws/credentials처럼 민감한 정보를 빼내거나 시스템을 망가뜨릴 수 있는 명령이다. Scale X는 32.9%의 session이 음수 점수로 끝났고, 7%는 모든 prompt를 승인했다고 밝혔다.
숫자에는 중요한 단서도 붙어 있다. 이 게임에서는 플레이어가 본 명령의 약 34%가 위협이었고, 시간 압박도 있었다. 실제 업무에서는 위험 명령 비율이 이렇게 높지 않을 수 있다. 그래서 이 결과를 현실 보안 사고율로 읽으면 곤란하다. 더 정확한 쓰임은 사람 승인이라는 패턴이 얼마나 쉽게 습관화되는지 보는 데 있다.
HN에서는 이 지점이 논쟁이 됐다. 2026-08-06 11:58:07Z에 올라온 글은 크롤링 시점 기준 334점과 243개 댓글을 모았다. 일부 댓글은 게임의 시간 제한과 낮은 실제 비용 때문에 결과를 과대해석하면 안 된다고 봤다. 반대로 많은 댓글은 반복되는 “Yes” 확인창이 사용자를 무감각하게 만든다는 오래된 UX 보안 문제를 짚었다.
AI agent에서는 이 문제가 더 날카롭다. agent는 한 번 승인받은 뒤 파일을 읽고, 패키지를 설치하고, 네트워크를 호출하고, 셸 명령을 이어갈 수 있다. 사람이 마지막 방어선이라면, 사람은 매번 문맥과 의도를 제대로 읽어야 한다. 실무에서는 sandbox, 네트워크 제한, 권한 분리, 명령별 정책 같은 구조적 방어가 먼저 필요하다. 승인 버튼은 그 위에 얹는 확인 장치일 뿐이다.
관련 기사
Stanford의 jai, Linux에서 AI agent를 감싸는 경량 안전 레이어로 Hacker News 주목
2026년 3월 Hacker News에서 Stanford SCS의 `jai`가 604 points와 313 comments를 기록했다. 이 도구는 현재 작업 디렉터리는 그대로 쓰게 두고, 나머지 home 영역은 overlay 또는 숨김 처리해 AI agent의 파일 손상 범위를 줄이려는 Linux용 containment 도구다.
Anthropic, 클로드 악용 위협 보고서 공개 — 9개월간 7개 분야 차단 기록
Anthropic이 2025년 12월~2026년 8월 클로드 악용 사례를 7개 분야(사이버 작전·영향력 공작·감시·사기·생물학·무기·모델 증류)로 정리한 첫 번째 위협 보고서를 발표했다. 국가 지원 의심 그룹부터 상업용 스파이웨어 기업까지 광범위한 행위자가 포함됐다.
AI 에이전트 스킬 레지스트리 ClawHub에서 악성 스킬 발견... 보안 우려 확산
Hacker News에서 공개 AI 에이전트 스킬 레지스트리 ClawHub에 악성 스킬이 발견되었다고 보고. 자율 AI 도구의 지속적 메모리, 광범위한 권한, 사용자 제어 구성이 기존 위험을 증폭시킬 수 있다는 우려.