NVIDIA AVO, ARC-AGI-3 공개 벤치마크 전 183레벨 완파 — 에이전트 하네스가 모델 성능 3배 이상 증폭
30%에서 100%로 — 에이전트 하네스의 위력
NVIDIA는 8월 21일 자율 에이전트 시스템 AVO(Agentic Variation Operators)가 ARC-AGI-3 공개 세트 25개 환경 전체에 걸쳐 183개 레벨을 100% 완수했다고 발표했다. 기반 모델인 Claude Opus 5의 단독 점수는 30.2%에 불과하지만, AVO 하네스로 구동하자 만점을 기록했다.
ARC-AGI-3는 에이전트가 명시적 규칙이나 목표 설명 없이 낯선 환경에 진입해 스스로 규칙을 파악해야 하는 인터랙티브 추론 벤치마크다. NVIDIA의 AVO는 메모리·툴·실행 피드백을 활용해 검사·계획·구현·평가 사이클을 지속 반복하며, 이전 시스템 대비 12% 적은 6,624회 액션으로 모든 레벨을 완료했다.
주의사항: 공개 세트만 평가
NVIDIA가 공개한 결과는 ARC-AGI-3의 공개 세트(Public Set)에 한정된다. ARC-AGI 벤치마크 시리즈는 역사적으로 비공개 테스트 세트로 일반화 능력을 평가해왔다. 비공개 세트 결과가 공개되지 않은 만큼, 100% 점수는 인상적이지만 범용 추론 능력의 완전한 척도로 보기는 이르다는 평가도 있다.
그럼에도 이번 결과는 동일한 기반 모델도 에이전트 아키텍처 설계에 따라 성능이 극적으로 달라질 수 있음을 명확히 보여준다는 점에서 AI 에이전트 연구의 중요한 이정표로 꼽힌다.
Related Articles
DeepMind 출신 4인이 설립한 런던 스타트업 Inherent이 27B 에이전트 Faraday로 GPT-5.5와 Claude Opus 4.8을 과학 논문 재현 테스트에서 앞섰다고 발표했다. 2026년 5월 $5000만 시드 라운드로 스텔스를 해제했다.
NVIDIA Research의 Spatial-IQ는 3D 물체 세기를 9개 하위 과제로 쪼개 모델의 실패 지점을 분리한다. 인간 정확도 82.1%에 비해 최고 범용 멀티모달 모델은 17.7%였고, Qwen2.5-VL-32B는 훈련 후 2.9%에서 62.6%로 올랐다.
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.