Cosmos 3 Edge、4B世界モデルでphysical AIをedgeへ寄せる
Original: At SIGGRAPH, NVIDIA Advances Graphics and Simulation With Agentic and Physical AI View original →
physical AIの争点は、性能表だけでなく「どこで動くか」に移っている。 NVIDIAが7月20日のSIGGRAPHで示した更新は、ロボット、映像検証、simulation、ローカル制作agentを同じ配備論でつないでいる。NVIDIA公式Blogは、Cosmos 3 Edge、Synthetic Video Detector NIM、制作ツール向けMCP接続、DGX Station Agent Toolkitをまとめて紹介した。
最も大きい製品要素はCosmos 3 Edgeだ。これは4B parameterのomnimodelで、Jetson、RTX PRO、DGX、GeForce RTX GPU上でmemory効率と高throughputを狙う。text、image、video、ambient sound、actionを扱い、mixture-of-transformers構造で物理的にgroundedなreal-time vision analyticsとrobot actionをdevice上で処理する。NVIDIAは、同parameter classのVANTAGE-Bench vision analytics successで1位だとしている。
映像検証にも具体的な数値が出た。Synthetic Video Detector NIM microserviceは、videoをframe単位で分析し、synthetic contentの可能性スコアを返す。NVIDIAのテストでは、accuracyはuncompressed videoで最大92%、15% compressionで87%、50% compressionで82%。処理速度はNVIDIA RTX systemで1080p videoを最短22 milliseconds、NVIDIA L40 GPUで約30 millisecondsだ。Wowzaはこのmicroserviceを、170か国以上・35,000以上のdeploymentで使われるlivestreaming frameworkに組み込む。
ローカルagentの方向性も明確だ。DGX Station用NVIDIA Agent Toolkitは、NemoClaw、Nemotron 3 Ultra、Omniverse libraries、OpenShell secure runtimeをひとつのsystemにまとめる。Nemotron 3 Ultraは550B parameterのopen modelで、DGX Station GB300は最大20 petaflopsのFP4 AI computeと748GB coherent memoryを提供する。制作現場や工学チームが、機密性の高いscene、sensor data、simulation workflowを外部サービスに出さず扱える構成になる。
次の焦点は現場の数字だ。Cosmos 3 EdgeはHugging FaceとGitHubで利用可能だが、robotics、newsroom、industrial inspectionでlatency、false positive、tuning cost、信頼性がどう出るかが、この更新の価値を決める。
Related Articles
NVIDIAはCosmos 3 Nanoを交通安全動画QA向けに後処理し、精度を54.41%から93.35%へ引き上げた。LoRAとTAO AutoMLをagentが実行する流れが焦点だ。
動画分析パイプラインの構築は、手作業の設定から自然言語とcoding agentの組み合わせへ移り始めている。DeepStream 9.1は13個のagentic skillsとJetPack 7.2対応を含む。
MicrosoftはMarch 16, 2026のNVIDIA GTCで、Foundry Agent Serviceとobservabilityのgeneral availability、NVIDIA Nemotron model追加、Vera Rubin NVL72を見据えたAzure AI infrastructure拡張、そしてAzure Physical AI Toolchain公開を発表した。agent運用、inference基盤、physical-world AIをひとつのenterprise stackとして示した点が大きい。