LLM 레딧
METR 후속 업데이트: AI 코딩 도구, “20% 감속”에서 “가속 가능성”으로
r/singularity에서 공유된 METR 후속 글은 2025년 “AI 사용 시 20% 감속” 결과 이후, 최신 도구 환경에서는 생산성 효과가 달라질 수 있음을 보여준다. 다만 연구팀은 강한 선택 편향 때문에 정밀한 추정은 어렵다고 명확히 밝혔다.
2분 소요 38 조회
태그
#evaluation 태그가 달린 기사
r/singularity에서 공유된 METR 후속 글은 2025년 “AI 사용 시 20% 감속” 결과 이후, 최신 도구 환경에서는 생산성 효과가 달라질 수 있음을 보여준다. 다만 연구팀은 강한 선택 편향 때문에 정밀한 추정은 어렵다고 명확히 밝혔다.
Hacker News에서 높은 반응을 얻은 글은 동일한 정책 의미라도 언어가 바뀌면 guardrail 점수가 36-53%까지 달라질 수 있다고 보고하며, 다국어 안전성 평가의 구조적 공백을 지적한다.
Hacker News에서 주목받은 SkillsBench 논문은 86개 태스크·11개 도메인에서 Agent Skill의 실제 효용을 비교했다. curated skill은 평균 통과율을 크게 끌어올렸지만, 모델이 직접 만든 skill은 평균 개선 효과를 보이지 않았다.
NIST 산하 CAISI는 2026년 1월 30일 언어모델 자동 벤치마크 평가 가이드 초안 NIST AI 800-2를 공개하고 3월 31일까지 공개 의견을 받는다. 문서는 평가 목표 정의, 실행, 결과 분석·보고의 실무 절차를 제시한다.
LocalLLaMA 토론에서 공유된 SWE-rebench 1월 결과는 Claude Code 선두 속에 상위 모델 격차 축소와 오픈 모델 추격을 보여줬다.