NVIDIA의 NOOA 공개, SWE-bench 82.2%와 CyberGym 86.8%가 가리키는 새 에이전트 기준
Original: NVIDIA Opens NOOA Agent Harness With 82.2% SWE-bench and 86.8% CyberGym Scores View original →
NOOA가 겨냥한 것은 모델이 아니라 에이전트 구조
NVIDIA가 공개한 NOOA는 LLM 에이전트의 성능을 모델 교체가 아니라 하네스 설계로 끌어올리려는 연구 프레임워크다. 핵심 숫자는 분명하다. NVIDIA 기술 블로그는 NOOA가 SWE-bench Verified에서 GPT-5.5 기준 82.2%, CyberGym L1에서 86.8%를 기록했고, ARC-AGI-3에서도 GPT-5.6-sol 조합으로 85.1% mean RHAE에 도달했다고 설명한다.
“We're contributing open models, weights, data and research to the Open Secure AI Alliance. This includes NVIDIA Labs Object-Oriented Agents (NOOA): open agent harness research in the form of an object-oriented framework that reaches state-of-the-art results across software engineering, cybersecurity and reasoning benchmarks.”
NVIDIA AI의 원문 트윗은 NOOA를 Open Secure AI Alliance에 제공하는 공개 연구로 소개한다. @NVIDIAAI는 주로 개발자용 AI 모델, GPU 기반 추론, 에이전트 프레임워크, NVIDIA 개발자 블로그의 벤치마크를 배포하는 계정이다. 이번 트윗도 단순 홍보보다 구현 방식과 벤치마크 수치를 앞세운 기술 신호에 가깝다.
NOOA의 설계는 에이전트를 하나의 Python 클래스로 다루는 데 있다. 메서드는 능력, 필드는 상태, docstring은 프롬프트, 타입 주석은 계약으로 쓰인다. LLM은 ellipsis로 비워 둔 메서드 본문을 실행 중 채우고, 일반 Python 코드는 결정적으로 실행된다. 이런 구조 덕분에 에이전트를 diff, 코드 리뷰, 단위 테스트, 추적, 버전 관리의 대상으로 만들 수 있다는 것이 NVIDIA의 주장이다.
흥미로운 부분은 비용이다. 블로그에 따르면 NOOA는 SWE-bench Verified에서 작업당 약 29회의 LLM 호출과 110만 토큰으로 82.2%를 기록했다. 비교 하네스는 66회 호출과 220만 토큰으로 78.2%에 머물렀다. 결과가 재현된다면 에이전트 제품의 병목은 프롬프트 길이가 아니라 상태 표현, 도구 결과 전달 방식, 검증 루프라는 결론이 강해진다.
다음 확인 지점은 공개 코드와 평가 방법이다. Open Secure AI Alliance 참여가 실제 표준화된 보안 검증, 에이전트 메모리 관리, SWE-bench 재현 실험으로 이어지는지 봐야 한다. 특히 CyberGym 결과는 네트워크 접근을 막고 cheat check를 적용했다는 점이 중요하므로, 외부 연구자가 같은 조건에서 86.8%에 가까운 값을 얻는지가 관건이다.
Related Articles
Google의 새 Gemini Flash 라인업에서 관심은 모델 이름보다 토큰 효율과 agent workflow 비용에 모였다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄였고, Cyber 모델은 CodeMender와 묶였다.
r/MachineLearning의 신선한 프로젝트 글은 모델을 다시 학습시키지 않고 harness 자체를 최적화하는 방식을 제안한다.
대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.