Nemotron 3 Nano, 5달러 미만 RL로 수학 정확도 22%에서 91%까지 상승
Original: Nemotron 3 Nano RL Run Jumps From 22% to 91% for Under $5 View original →
작은 모델을 빠르게 맞춤화하는 실험
소형 모델의 실전 가치는 사전학습 성능만이 아니라, 특정 업무에 얼마나 싸고 빠르게 적응하는지에서 갈린다. NVIDIA AI는 2026년 7월 23일 X에서 Nemotron 3 Nano가 호스팅된 RL 실행으로 수학 과제 정확도를 “22% to 91% accuracy”까지 끌어올렸다고 전했다.
“22% to 91% accuracy” — NVIDIA AI
트윗의 핵심 수치는 비용이다. Prime Intellect Lab을 사용한 전체 루프가 5달러 미만으로 끝났고, 기준 성능을 확인한 뒤 보상이 오를 때까지 훈련하고, 다시 테스트해 실제 학습 여부를 확인하며, 마지막에는 다운로드 가능한 LoRA 어댑터를 얻는 흐름이다. 같은 방식은 한 줄 변경으로 Nemotron 3 Super와 Ultra까지 확장할 수 있다고 NVIDIA는 덧붙였다.
오픈 모델 운영의 새로운 기준
이 사례가 중요한 이유는 거대한 범용 모델을 매번 호출하는 대신, 작은 모델을 과제별로 얇게 조정해 배포하는 경제성을 보여주기 때문이다. 22%에서 91%라는 변화는 범용 지능의 증거가 아니라, 평가 가능한 좁은 과제에서 RL과 어댑터 방식이 얼마나 빠르게 효과를 낼 수 있는지를 보여주는 운영 신호다.
NVIDIA AI 계정은 Nemotron 모델군, 개발자 블로그, GPU 기반 워크플로를 함께 소개하는 채널이다. 이번 게시물은 Prime Intellect Lab과 연결된 호스팅 RL 루프를 강조했고, 결과물은 LoRA 어댑터 형태로 재사용할 수 있다는 점을 내세웠다. 다음 관전점은 이 접근이 수학 단일 과제를 넘어 코드, 도구 사용, 도메인별 추론처럼 실패 양상이 복잡한 작업에서도 같은 비용 대비 개선을 낼 수 있는지다.
Related Articles
NVIDIA의 Nemotron 3 Embed가 LMEB에서 8B 모델 1위, 1B 모델 2위를 기록하며 에이전트 기억 검색 경쟁을 넓혔다. Hugging Face 글에 따르면 8B는 LMEB 64.4, 1B BF16은 61.5를 기록해 장기 대화 검색 성능을 전면에 세웠다.
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
LLM 추론 속도를 높이는 다른 경로가 등장했다. NVIDIA의 Nemotron-Labs-TwoTower는 30B 백본을 두 타워 확산 모델로 바꿔 98.7% 품질과 2.42배 처리량을 동시에 제시했다.