코드 리뷰 품질 2.17배, OpenCodeReview 통제형 에이전트로 토큰 5~15배 절감
Original: OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review View original →
코드 리뷰 에이전트의 성능을 끌어올린 것은 더 큰 모델이나 더 긴 추론이 아니었다. 탐색 범위와 역할을 의도적으로 제한한 설계였다. Alibaba 연구팀이 공개한 OpenCodeReview 논문에 따르면, 최고 구성은 같은 기반 모델을 쓴 Claude Code보다 SEM-F1이 11.57%에서 25.10%로 올라 2.17배를 기록했다. 토큰 사용량은 비교 대상보다 5~15배 적었다.
평가 규모도 작은 예제 모음 수준은 아니다. AACR-Bench는 50개 오픈소스 저장소에서 가져온 실제 pull request 200개와 10개 프로그래밍 언어를 포함한다. 정답 집합은 80명 넘는 시니어 엔지니어가 세 차례 교차 검증한 1,505개 리뷰 의견으로 구성됐다. 연구팀은 Claude Code와 Codex를 포함한 비교군을 여섯 가지 LLM 백엔드에서 시험했으며, OpenCodeReview가 모든 구성에서 가장 높은 SEM-F1을 냈다고 보고했다.
차이는 세 단계에서 나왔다. Rule-Guided Dispatch는 변경 파일과 점검 기준을 규칙으로 배정한다. Grounded File Review는 범용 셸 대신 출력이 제한된 전용 도구로 호출자, 피호출자, 데이터 흐름 같은 저장소 문맥을 찾고 파일 단위 하위 에이전트를 병렬로 운용한다. Independent Reflection은 생성 단계가 본 저장소 탐색 기록을 숨긴 채 diff만 보고 각 의견을 반증하려 한다. 자기 답을 스스로 칭찬하는 검증 루프를 피하려는 정보 경계다.
이 구조는 현재 코드 리뷰 에이전트의 두 약점을 정면으로 겨냥한다. diff 주변만 보면 먼 호출부의 회귀를 놓치기 쉽고, 반대로 unrestricted shell을 주면 관련 없는 파일까지 읽으며 비용과 결과 변동성이 커진다. 그럴듯하지만 틀린 의견 한 줄은 사람이 다시 검증해야 하므로 자동화의 이득도 빠르게 사라진다. 논문이 인용한 3,109개 PR 분석에서는 에이전트만 리뷰한 PR의 병합률이 45.2%로 사람만 리뷰한 경우의 68.4%보다 낮았고, 거절된 에이전트 리뷰의 60%는 신호 대 잡음 비율이 30% 미만이었다.
다만 25.10%라는 절대 점수는 자동 리뷰가 사람을 대체할 수준이라는 뜻이 아니다. AACR-Bench의 정답도 AI 보조와 전문가 검증으로 만들어졌고, 규칙 체계는 저장소와 언어가 바뀔 때 유지보수가 필요하다. 연구팀도 다음 과제로 과거 리뷰에서 규칙을 자동 추출하는 방법을 꼽았다.
그래도 실무적 메시지는 선명하다. 에이전트의 도구 권한을 넓히는 것보다 필요한 탐색만 허용하고, 생성자와 검증자가 보는 증거를 분리하는 편이 더 정확하고 저렴할 수 있다. 코드가 공개된 만큼 이제 볼 지표는 독립 팀의 재현 결과와 실제 저장소에서의 오탐률이다.
Related Articles
2026-07-28 MCP specification release candidate가 transport-level session management를 제거했다. Google은 Python, TypeScript, Go, C# beta SDK가 이미 새 규격을 지원하며, GitHub MCP Server도 Redis session storage를 없앴다고 밝혔다.
660점까지 오른 논점은 “agent를 Slack과 웹에서 여러 사람이 함께 쓰면 권한, 메모리, 샌드박스를 어떻게 나눌 것인가”에 모였다.
Alibaba의 Qwen 팀이 Qwen 3.5 소형 모델 시리즈(0.8B~9B)를 공개했습니다. WebGPU로 브라우저에서도 실행 가능하며, 이전 세대 대비 벤치마크 성능이 대폭 향상되었습니다.