본문으로 건너뛰기

AI Agent Benchmark Watch: 점수, 도구 사용, judge 신뢰성

5 편 2026년 4월 19일 업데이트 #benchmarks#evaluation#agents#ai-agents

현재 상황

Berkeley의 benchmark hacking 분석, IBM VAKRA, AIBuildAI, HWE-Bench, LLM judge reliability, MM-WebAgent, eval-faking 연구를 시간순으로 묶어 agent 평가가 어디서 과장되고 어디서 실제 성능으로 이어지는지 추적합니다.

최근 변화

  • LLM judge, stakes 한 줄에 unsafe 판정이 30%까지 눈에 띄게 흔들렸다
  • MM-WebAgent, 이미지·코드·레이아웃을 따로 놀지 않게 묶었다
  • LLM judge, 문서 33-67%에서 일관성 붕괴를 숨겼다

핵심 쟁점

낙관론: AI Agent Benchmark Watch: 점수, 도구 사용, judge 신뢰성이(가) 실질적이고 누적되는 레버리지를 만들어냅니다.
신중론: AI Agent Benchmark Watch: 점수, 도구 사용, judge 신뢰성의 신뢰성·비용·통제 문제는 아직 해결되지 않았습니다.

주목할 신호

  • ‘benchmarks’ 관련 모멘텀과 새로운 보도
  • ‘evaluation’ 관련 모멘텀과 새로운 보도
  • ‘agents’ 관련 모멘텀과 새로운 보도

타임라인

최신
최근 전개
최근 전개
최근 전개
최근 전개
공유: 긴글