본문으로 건너뛰기

Nemotron 3.5 Lightning, 3B 활성 매개변수로 에이전트 출력을 최대 4배 가속

Original: Nemotron 3.5 Lightning Runs Agent Tasks Up to 4x Faster View original →

Read in other languages: English日本語
LLM Aug 12, 2026 By Insights AI (Twitter) 1 min read Source
Nemotron 3.5 Lightning, 3B 활성 매개변수로 에이전트 출력을 최대 4배 가속

계획보다 실행에 맞춘 30B 모델

장시간 동작하는 AI 에이전트의 비용 병목은 복잡한 계획보다 반복적인 도구 호출, 결과 검증, 작업 위임에서 생긴다. NVIDIA Nemotron 3.5 Lightning은 이 실행 구간을 맡도록 설계된 30B 혼합 전문가 모델이다. 토큰마다 3B 매개변수만 활성화해 큰 모델의 용량과 작은 모델의 계산 비용을 결합한다.

“An open 30B MoE model with 3B active parameters, built for always-on agents.”

NVIDIA의 원문 게시물은 동급 모델 대비 최대 4배의 출력 속도를 핵심 수치로 제시했다. 후속 설명에서는 PinchBench 1만 개 작업에서 86% 정확도를 기록하고, 비슷한 정확도의 Qwen3.6 35B보다 완료 시간이 더 짧았다고 밝혔다. 단순 초당 토큰 수가 아니라 실제 에이전트 작업을 끝내는 시간을 측정했다는 점이 중요하다.

공개 가중치와 라우팅을 한 묶음으로

NVIDIA의 기술 블로그는 Lightning을 Nemotron 3 Ultra 같은 대형 추론 모델과 함께 쓰는 구조를 제안한다. 큰 모델은 계획과 어려운 판단을 맡고, Lightning은 Git 명령 실행, 도구 출력 검사, 형식 변환처럼 호출량이 많은 단계를 처리한다. 새 공개 라이브러리 NeMo Switchyard는 요청마다 적절한 모델로 보내는 라우팅 계층을 제공한다.

모델은 BF16과 NVFP4 체크포인트로 제공되며, 다중 토큰 예측과 추측 디코딩을 지원한다. 가중치뿐 아니라 학습 데이터와 레시피도 OpenMDW-1.1 조건으로 공개됐다. 코딩 에이전트 능력의 후학습에 사용한 Nemotron-RL Agentic Terminal Pivot 데이터셋도 함께 배포됐다. 실행 환경은 DGX Spark부터 데이터센터까지를 겨냥하고, Ollama, llama.cpp, LM Studio, Unsloth 등과 연결된다.

확인할 성능 경계

최대 4배 출력 속도는 하드웨어, 동시성, 디코딩 설정에 따라 달라질 수 있다. 개발자가 확인할 다음 지점은 각자의 도구 호출 분포에서 정확도와 지연 시간이 유지되는지, 3B 활성 구조가 긴 작업에서 오류 누적을 줄일 수 있는지다. Switchyard가 서로 다른 공개·비공개 모델을 안정적으로 조합하는지도 실제 운영 비용을 좌우한다.

Share: Long

Related Articles

LLM X/Twitter Mar 11, 2026 1 min read

NVIDIA AI Developer는 2026년 3월 11일 Nemotron 3 Super를 공개하며, 12B active parameters를 사용하는 오픈 120B-parameter hybrid MoE 모델과 native 1M-token context를 강조했다. NVIDIA는 이 모델이 이전 Nemotron Super 대비 최대 5배 높은 throughput으로 agentic workload를 겨냥한다고 설명했다.

LLM Reddit Mar 16, 2026 2 min read

3월 15일 LocalLLaMA에서 높은 반응을 얻은 Nemotron license thread는 model release에서 weights만큼 중요한 것이 license wording임을 다시 보여 줬다. 공식 NVIDIA Nemotron Model License와 이전 Open Model License를 비교하면, community가 주목한 포인트는 예전 guardrail termination clause와 Trustworthy AI 참조가 사라지고, 대신 NOTICE 중심의 attribution 구조가 더 전면으로 나온 점이었다.