NVIDIA Nemotron 3 Nano Omni公開 — ビジョン・音声・言語統合の30Bオープンモデル、同クラス比9倍スループット
マルチモーダルエージェント向けオープンモデル
NVIDIAは2026年4月28日、Nemotron 3 Nano Omniを公開した。Hugging Face、OpenRouter、build.nvidia.comなど25以上のプラットフォームで即日利用可能だ。
技術仕様
- アーキテクチャ: 30B-A3B ハイブリッドMoE(Conv3D、EVS搭載)
- コンテキスト: 256Kトークン
- 処理対象: ビデオ・オーディオ・画像・テキストを単一モデルで処理
- スループット: 同クラスのオープンオムニモデルより9倍高速
マルチモーダルエージェントに最適化
従来のマルチモーダルパイプラインでは、視覚・音声・言語をそれぞれ別システムで処理する必要があった。Nemotron 3 Nano Omniはこれを単一モデルに統合し、複数モダリティをリアルタイムで処理するエージェントに最適化されている。
導入状況
Aible、ASI、Eka Care、Foxconn、H Company、Palantir、Pylerがすでに採用。Dell Technologies、Docusign、Infosys、Oracle、Zefrが評価中だ。
出典: NVIDIA Blog
Related Articles
지원되는 Hugging Face 모델을 ONNX 중간 변환 없이 두 명령으로 TensorRT 추론 번들로 만들 수 있게 됐다. NVIDIA의 TensorRT Model Connect는 같은 번들을 네이티브 C++ API에서 실행하며, 전체 프로젝트는 Codex 에이전트와 사람의 검토로 구축됐다.
NVIDIA가 Microsoft, Cloudflare, Hugging Face, Palantir 등과 Open Secure AI Alliance를 띄웠다. 핵심은 AI agent 보안을 닫힌 모델 접근권이 아니라 공개 모델, harness, 평가 도구로 방어하겠다는 주장이다.
NVIDIA Research의 Spatial-IQ는 3D 물체 세기를 9개 하위 과제로 쪼개 모델의 실패 지점을 분리한다. 인간 정확도 82.1%에 비해 최고 범용 멀티모달 모델은 17.7%였고, Qwen2.5-VL-32B는 훈련 후 2.9%에서 62.6%로 올랐다.