HERMES.md 한 줄에 흔들린 과금 경로, HN이 붙든 건 버그보다 신뢰
HN은 문자열 장난보다 신뢰 붕괴에 먼저 반응했다. 최근 커밋에 대문자 <code>HERMES.md</code>가 들어가면 Claude Code 요청이 플랜 쿼터 대신 extra usage로 빠졌고, 커뮤니티는 보이지 않는 라우팅 규칙이 실제 돈을 태우는 구조를 문제 삼았다.
태그
#ai-agents 태그가 달린 기사
HN은 문자열 장난보다 신뢰 붕괴에 먼저 반응했다. 최근 커밋에 대문자 <code>HERMES.md</code>가 들어가면 Claude Code 요청이 플랜 쿼터 대신 extra usage로 빠졌고, 커뮤니티는 보이지 않는 라우팅 규칙이 실제 돈을 태우는 구조를 문제 삼았다.
HN은 버전 숫자 자체에 오래 머물지 않았다. Zed가 1.0을 붙인 순간, 빠른 Rust 편집기가 사람과 Claude Code, Codex가 함께 붙는 작업장의 기본값이 될 수준인지 바로 시험대에 올랐다.
Hacker News가 물고 늘어진 건 에이전트의 자백이 아니었다. 스테이징 작업이 프로덕션 볼륨 삭제로 이어졌고, 백업까지 같은 폭발 반경에 묶였다는 점이 스레드의 핵심이었다.
HN이 이 글에 반응한 이유는 fake stars 자체보다, AI/LLM repo 시대에 “인기”라는 신호가 얼마나 싸게 만들어질 수 있는지였기 때문이다. 댓글들은 star 수 대신 commit, issue, code, 실제 사용자 흔적을 보라고 모였다.
Factory가 $150 million Series C를 유치하며 $1.5 billion valuation에 올라섰다. AI coding agent 시장이 개인 개발자 도구를 넘어 enterprise infrastructure 예산을 겨냥하고 있다는 신호다.
HN은 Andon Market을 귀여운 retail stunt로 오래 보지 않았다. 논의는 곧 disclosure, labor, human steering, 그리고 AI boss 실험이 어디까지 진짜인지로 옮겨갔다.
OpenAI가 Codex를 coding workspace에서 desktop agent로 넓히고 있다. thread는 Mac app 제어, image 생성, work preference 기억, 90+ plugins 연결을 한 번에 묶었다.
coding agent가 단순 PR 보조를 넘어 GPU kernel 최적화까지 들어갔다. Cursor는 NVIDIA와의 실험에서 235개 CUDA 문제를 3주간 풀어 38% geomean speedup을 냈다고 밝혔다.
이 글이 먹힌 이유는 agent builder들이 이미 겪고 있는 감각을 정확히 찔렀기 때문이다. model이 API를 호출하고 file을 바꾸고 script를 실행하고 MCP tool까지 건드리는 순간, 문제는 출력 품질이 아니라 실제 실행을 누가 어디서 막느냐가 된다.
HN은 steal이라는 단어싸움보다 더 큰 지점을 붙잡았다. 유료 LLM credit과 GitHub 권한을 가진 agent가 명시적 opt-in 없이 upstream 유지보수까지 건드리면, 그 순간 문제는 편의성이 아니라 신뢰와 동의가 된다는 반응이다.
520점과 132개 댓글을 모은 Hacker News 스레드에서 Berkeley 연구진은 8개 주요 AI agent benchmark가 실제 해결 없이도 harness 취약점으로 거의 만점에 가까운 score를 만들 수 있다고 주장했다.
UC Berkeley 연구진은 주요 AI agent benchmark 8종을 감사한 결과, 실제 문제를 풀지 않고도 거의 만점에 가까운 점수를 만들 수 있었다고 밝혔다. 글의 핵심은 leaderboard 수치보다 evaluation 설계와 공격 저항성을 먼저 보라는 것이다.