Nemotron 3 Nano、5ドル未満のRLで数学精度22%から91%へ
Original: Nemotron 3 Nano RL Run Jumps From 22% to 91% for Under $5 View original →
狭いタスクなら小型モデルを安く伸ばせる
小型モデルの価値は、初期性能だけでなく、特定タスクへどれだけ低コストに適応できるかで決まる。NVIDIA AIは7月23日、ホスト型の強化学習実行によってNemotron 3 Nanoの数学タスク精度を“22% to 91% accuracy”へ引き上げたと投稿した。
“22% to 91% accuracy” — NVIDIA AI
投稿で強調されたのは費用と手順だ。Prime Intellect Labを使い、ベースラインを確認し、報酬が上がるまで訓練し、再テストで学習を確認し、最後にダウンロード可能なLoRAアダプターを得る。全体の費用は5ドル未満で、Nemotron 3 SuperやUltraにも1行変更で広げられるとしている。
22%から91%という数字の読み方
この結果は、広い推論能力の証明ではなく、評価可能な数学タスクでの改善として読むべきだ。それでも意味は大きい。数ドルで再利用できるアダプターを作れるなら、すべてを大型モデルに投げるのではなく、小型モデルを用途別に薄く調整して使う選択肢が現実味を帯びる。レイテンシ、費用、データ管理、運用制御のバランスが変わる。
NVIDIA AIのアカウントは、Nemotronモデル群とGPU開発者向けワークフローを結びつけて紹介することが多い。今回の投稿も静的なベンチマークではなく、RL調整の手順を前面に出している。次に見るべき点は、この低コストの方法がコード、ツール利用、専門領域の推論など、報酬設計が難しいタスクでも同じように機能するかだ。
Related Articles
NVIDIAのNemotron 3 EmbedはLMEBで8Bモデルが1位、1Bモデルが2位となり、長期会話から必要情報を拾う検索性能を押し出した。Hugging Faceの更新では8Bが64.4、1B BF16が61.5とされている。
LocalLLaMAの関心は、diffusion LLMが品質を保ったまま生成速度を本当に上げられるのかに集まった。
LLM decodingを速くする別経路が出てきた。NVIDIAのNemotron-Labs-TwoTowerは30B backboneをtwo-tower diffusion modelへ変え、品質98.7%と2.42倍throughputを示した。