본문으로 건너뛰기

NVIDIA AVO, ARC-AGI-3 공개 벤치마크 전 183레벨 완파 — 에이전트 하네스가 모델 성능 3배 이상 증폭

Read in other languages: English日本語
AI Aug 27, 2026 By Insights AI 1 min read 1 views Source

30%에서 100%로 — 에이전트 하네스의 위력

NVIDIA는 8월 21일 자율 에이전트 시스템 AVO(Agentic Variation Operators)가 ARC-AGI-3 공개 세트 25개 환경 전체에 걸쳐 183개 레벨을 100% 완수했다고 발표했다. 기반 모델인 Claude Opus 5의 단독 점수는 30.2%에 불과하지만, AVO 하네스로 구동하자 만점을 기록했다.

ARC-AGI-3는 에이전트가 명시적 규칙이나 목표 설명 없이 낯선 환경에 진입해 스스로 규칙을 파악해야 하는 인터랙티브 추론 벤치마크다. NVIDIA의 AVO는 메모리·툴·실행 피드백을 활용해 검사·계획·구현·평가 사이클을 지속 반복하며, 이전 시스템 대비 12% 적은 6,624회 액션으로 모든 레벨을 완료했다.

주의사항: 공개 세트만 평가

NVIDIA가 공개한 결과는 ARC-AGI-3의 공개 세트(Public Set)에 한정된다. ARC-AGI 벤치마크 시리즈는 역사적으로 비공개 테스트 세트로 일반화 능력을 평가해왔다. 비공개 세트 결과가 공개되지 않은 만큼, 100% 점수는 인상적이지만 범용 추론 능력의 완전한 척도로 보기는 이르다는 평가도 있다.

그럼에도 이번 결과는 동일한 기반 모델도 에이전트 아키텍처 설계에 따라 성능이 극적으로 달라질 수 있음을 명확히 보여준다는 점에서 AI 에이전트 연구의 중요한 이정표로 꼽힌다.

원문: NVIDIA Technical Blog

Share: Long

Related Articles