Nemotron 3 Nano, 5달러 미만 RL로 수학 정확도 22%에서 91%까지 상승
소형 오픈 모델도 짧은 RL 루프로 특정 과제 성능을 크게 끌어올릴 수 있다는 신호다. NVIDIA는 Nemotron 3 Nano가 5달러 미만 실험에서 22%에서 91%로 올랐다고 전했다.
원문: Nemotron 3 Nano RL Run Jumps From 22% to 91% for Under $5 원문 보기 →
작은 모델을 빠르게 맞춤화하는 실험
소형 모델의 실전 가치는 사전학습 성능만이 아니라, 특정 업무에 얼마나 싸고 빠르게 적응하는지에서 갈린다. NVIDIA AI는 2026년 7월 23일 X에서 Nemotron 3 Nano가 호스팅된 RL 실행으로 수학 과제 정확도를 “22% to 91% accuracy”까지 끌어올렸다고 전했다.
“22% to 91% accuracy” — NVIDIA AI
트윗의 핵심 수치는 비용이다. Prime Intellect Lab을 사용한 전체 루프가 5달러 미만으로 끝났고, 기준 성능을 확인한 뒤 보상이 오를 때까지 훈련하고, 다시 테스트해 실제 학습 여부를 확인하며, 마지막에는 다운로드 가능한 LoRA 어댑터를 얻는 흐름이다. 같은 방식은 한 줄 변경으로 Nemotron 3 Super와 Ultra까지 확장할 수 있다고 NVIDIA는 덧붙였다.
오픈 모델 운영의 새로운 기준
이 사례가 중요한 이유는 거대한 범용 모델을 매번 호출하는 대신, 작은 모델을 과제별로 얇게 조정해 배포하는 경제성을 보여주기 때문이다. 22%에서 91%라는 변화는 범용 지능의 증거가 아니라, 평가 가능한 좁은 과제에서 RL과 어댑터 방식이 얼마나 빠르게 효과를 낼 수 있는지를 보여주는 운영 신호다.
NVIDIA AI 계정은 Nemotron 모델군, 개발자 블로그, GPU 기반 워크플로를 함께 소개하는 채널이다. 이번 게시물은 Prime Intellect Lab과 연결된 호스팅 RL 루프를 강조했고, 결과물은 LoRA 어댑터 형태로 재사용할 수 있다는 점을 내세웠다. 다음 관전점은 이 접근이 수학 단일 과제를 넘어 코드, 도구 사용, 도메인별 추론처럼 실패 양상이 복잡한 작업에서도 같은 비용 대비 개선을 낼 수 있는지다.
관련 기사
Nemotron 3.5 Lightning, 3B 활성 매개변수로 에이전트 출력을 최대 4배 가속
NVIDIA의 30B MoE 공개 모델은 토큰당 3B 매개변수만 활성화해 동급 모델보다 최대 4배 빠른 출력을 겨냥한다. PinchBench에서는 86% 정확도로 1만 개 작업을 Qwen3.6 35B보다 더 빨리 마쳤다.
80개 RL 환경서 보상 해킹 40%…Hacker-Opus가 사이버 공격까지 일반화한 경로
보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.
Nvidia, Poolside에 $6B 라이선스·$1B 투자 — 오픈웨이트 AI 코딩 모델 강화
Nvidia가 AI 코딩 스타트업 Poolside와 60억 달러 비독점 라이선스 계약을 체결하고 10억 달러 추가 투자를 단행했다. Poolside 기업 가치를 120억 달러로 끌어올린 이번 계약으로 100명 이상의 직원이 Nvidia의 오픈웨이트 Nemotron 모델 개발에 합류한다.