NVIDIA NeMo RL, FP8로 Qwen3-8B RL workload를 1.48x 가속
중요한 점은 post-training agent 경쟁이 inference speed뿐 아니라 reinforcement learning throughput에 달려 있다는 데 있다. NVIDIA는 NeMo RL의 FP8 path가 Qwen3-8B-Base에서 RL workload를 1.48x 빠르게 하면서 BF16 accuracy를 따라간다고 제시했다.
원문: NVIDIA NeMo RL supports FP8 to speed RL workloads by 1.48x on Qwen3-8B-Base 원문 보기 →
트윗이 드러낸 것
NVIDIA AI는 NeMo RL이 Qwen3-8B-Base에서 RL workload를 1.48x 빠르게 하기 위해 “supports FP8 to speed up RL workloads” 한다고 적었다. timestamp는 매우 빡빡하지만 유효하다. FxTwitter 기준 이 트윗은 2026-04-22T21:00:02Z에 생성되어, 사용자가 지정한 TODAY=2026-04-22T21:00:04Z보다 2초 이르다.
NVIDIA AI 계정은 applied AI infrastructure, NeMo, robotics, model optimization 관련 소식을 주로 전한다. 연결된 NVIDIA Technical Blog가 짧은 트윗 뒤의 핵심을 제공한다. 글은 reasoning-grade model을 위한 reinforcement learning, 특히 generation phase와 training phase가 서로 다른 throughput bottleneck을 만드는 GRPO 계열 workflow에 초점을 맞춘다.
FP8 결과의 의미
blog는 NeMo RL이 NVIDIA NeMo 안의 open-source library이며, RL을 위한 end-to-end FP8 recipe를 설명한다고 밝힌다. linear layer에서는 DeepSeek-V3 technical report에서 나온 block-wise FP8 quantization 방식을 쓴다. NVIDIA는 FP8 math가 BF16 math보다 2x peak throughput을 낼 수 있고, 필요한 module은 BF16으로 남길 수 있다고 설명한다.
이 트윗의 핵심 benchmark는 Qwen3-8B-Base section이다. NVIDIA는 KV cache와 attention에 FP8을 적용하면 linear W8A8 setup 대비 rollout stage에서 추가 ~30% speedup이 나오고, BF16 대비 overall ~48% speedup이 나온다고 제시한다. token-level truncated importance sampling을 쓰면 low precision에서 생기는 numerical mismatch에도 validation accuracy가 BF16 baseline과 정렬된다고 설명한다.
이는 agentic tool use와 multi-step workflow가 post-training loop를 더 비싸게 만들기 때문에 중요하다. FP8 recipe가 accuracy를 유지하며 rollout throughput을 높인다면 team은 reward design, tool policy, reasoning behavior를 더 빨리 반복할 수 있다.
다음 관전점은 NVIDIA stack 밖에서의 재현성이다. 더 큰 MoE model, longer response, non-NVIDIA serving engine이 1.48x claim이 일반 recipe인지 특정 pipeline에 맞춘 결과인지 가를 것이다. 출처: NVIDIA AI source tweet · NVIDIA technical blog
관련 기사
Nemotron 3 Nano, 5달러 미만 RL로 수학 정확도 22%에서 91%까지 상승
소형 오픈 모델도 짧은 RL 루프로 특정 과제 성능을 크게 끌어올릴 수 있다는 신호다. NVIDIA는 Nemotron 3 Nano가 5달러 미만 실험에서 22%에서 91%로 올랐다고 전했다.
Nemotron 3.5 Lightning, 3B 활성 매개변수로 에이전트 출력을 최대 4배 가속
NVIDIA의 30B MoE 공개 모델은 토큰당 3B 매개변수만 활성화해 동급 모델보다 최대 4배 빠른 출력을 겨냥한다. PinchBench에서는 86% 정확도로 1만 개 작업을 Qwen3.6 35B보다 더 빨리 마쳤다.
Qwen 파생 모델 15만개 돌파…로컬 추론은 Llama의 5배·소형 83%·에이전트 급증
공개 모델 생태계의 실제 사용은 초대형 모델보다 작은 모델과 Qwen 계열에 집중됐다. Qwen 파생 저장소는 151,448개이며 월간 GGUF 다운로드는 3,960만건으로 Llama의 5배를 넘는다. 10억 매개변수 미만 모델이 누적 다운로드의 83%를 차지해 관심과 실사용의 격차를 드러냈다.