본문으로 건너뛰기
부식 중

NVIDIA의 NOOA 공개, SWE-bench 82.2%와 CyberGym 86.8%가 가리키는 새 에이전트 기준

에이전트 성능 경쟁이 모델 크기만의 문제가 아니라는 점이 숫자로 드러났다. NVIDIA는 NOOA가 SWE-bench Verified 82.2%, CyberGym L1 86.8%를 기록했다고 밝혔다.

원문: NVIDIA Opens NOOA Agent Harness With 82.2% SWE-bench and 86.8% CyberGym Scores 원문 보기 →

LLM X/Twitter 작성자 Insights AI (Twitter) 2분 소요 23 조회 출처

NOOA가 겨냥한 것은 모델이 아니라 에이전트 구조

NVIDIA가 공개한 NOOA는 LLM 에이전트의 성능을 모델 교체가 아니라 하네스 설계로 끌어올리려는 연구 프레임워크다. 핵심 숫자는 분명하다. NVIDIA 기술 블로그는 NOOA가 SWE-bench Verified에서 GPT-5.5 기준 82.2%, CyberGym L1에서 86.8%를 기록했고, ARC-AGI-3에서도 GPT-5.6-sol 조합으로 85.1% mean RHAE에 도달했다고 설명한다.

“We're contributing open models, weights, data and research to the Open Secure AI Alliance. This includes NVIDIA Labs Object-Oriented Agents (NOOA): open agent harness research in the form of an object-oriented framework that reaches state-of-the-art results across software engineering, cybersecurity and reasoning benchmarks.”

NVIDIA AI의 원문 트윗은 NOOA를 Open Secure AI Alliance에 제공하는 공개 연구로 소개한다. @NVIDIAAI는 주로 개발자용 AI 모델, GPU 기반 추론, 에이전트 프레임워크, NVIDIA 개발자 블로그의 벤치마크를 배포하는 계정이다. 이번 트윗도 단순 홍보보다 구현 방식과 벤치마크 수치를 앞세운 기술 신호에 가깝다.

NOOA의 설계는 에이전트를 하나의 Python 클래스로 다루는 데 있다. 메서드는 능력, 필드는 상태, docstring은 프롬프트, 타입 주석은 계약으로 쓰인다. LLM은 ellipsis로 비워 둔 메서드 본문을 실행 중 채우고, 일반 Python 코드는 결정적으로 실행된다. 이런 구조 덕분에 에이전트를 diff, 코드 리뷰, 단위 테스트, 추적, 버전 관리의 대상으로 만들 수 있다는 것이 NVIDIA의 주장이다.

흥미로운 부분은 비용이다. 블로그에 따르면 NOOA는 SWE-bench Verified에서 작업당 약 29회의 LLM 호출과 110만 토큰으로 82.2%를 기록했다. 비교 하네스는 66회 호출과 220만 토큰으로 78.2%에 머물렀다. 결과가 재현된다면 에이전트 제품의 병목은 프롬프트 길이가 아니라 상태 표현, 도구 결과 전달 방식, 검증 루프라는 결론이 강해진다.

다음 확인 지점은 공개 코드와 평가 방법이다. Open Secure AI Alliance 참여가 실제 표준화된 보안 검증, 에이전트 메모리 관리, SWE-bench 재현 실험으로 이어지는지 봐야 한다. 특히 CyberGym 결과는 네트워크 접근을 막고 cheat check를 적용했다는 점이 중요하므로, 외부 연구자가 같은 조건에서 86.8%에 가까운 값을 얻는지가 관건이다.

공유: 긴글

관련 기사

LLM X/Twitter

Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파

Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.

2분 소요 2 조회
LLM 레딧

r/LocalLLaMA가 주목한 NVIDIA의 open-weight 전략, $26B 투자 보도보다 더 중요한 Nemotron 신호

r/LocalLLaMA에서는 NVIDIA가 향후 5년간 open-weight AI model에 $26 billion을 투입할 수 있다는 보도가 빠르게 확산됐지만, 핵심 논의는 숫자보다 전략에 있었다. March 2026에 공개된 Nemotron 3 Super는 NVIDIA가 open model, tooling, Blackwell 최적화 deployment를 하나의 묶음으로 밀고 있음을 보여주는 가장 분명한 증거다.

2분 소요 53 조회