Cosmos 3 Edge, 4B world model로 edge physical AI 정조준
로봇과 영상 검증을 클라우드 밖으로 밀어내는 숫자가 나왔다. NVIDIA는 SIGGRAPH에서 4B Cosmos 3 Edge, Synthetic Video Detector NIM, DGX Station용 Nemotron 3 Ultra 스택을 한꺼번에 공개하며 physical AI의 배포 지점을 edge와 로컬 워크스테이션으로 좁혔다.
원문: At SIGGRAPH, NVIDIA Advances Graphics and Simulation With Agentic and Physical AI 원문 보기 →
physical AI의 병목이 모델 크기보다 배포 위치로 옮겨가고 있다. NVIDIA가 7월 20일 SIGGRAPH에서 공개한 묶음의 핵심은 거대한 데모가 아니라, 로봇·영상·제작 파이프라인이 클라우드 호출 없이 현장 장비에서 판단하도록 만드는 구성이다. 공식 NVIDIA Blog는 Cosmos 3 Edge, Synthetic Video Detector NIM, MCP 기반 제작도구 연결, DGX Station용 Agent Toolkit을 같은 흐름 안에 묶었다.
가장 직접적인 변화는 Cosmos 3 Edge다. 이 모델은 4B 파라미터 omnimodel로, Jetson, RTX PRO, DGX, GeForce RTX GPU에서 메모리 효율과 처리량을 맞추도록 설계됐다. 텍스트, 이미지, 비디오, ambient sound, action을 함께 다루며, mixture-of-transformers 구조로 실시간 vision analytics와 로봇 action을 장치 안에서 처리하는 쪽에 초점을 둔다. NVIDIA는 Cosmos 3 Edge가 같은 파라미터 급의 VANTAGE-Bench vision analytics success에서 1위라고 제시했다.
검증 영역도 숫자가 있다. Synthetic Video Detector NIM microservice는 영상을 프레임 단위로 분석해 synthetic content 가능성 점수를 낸다. NVIDIA 테스트 기준 정확도는 uncompressed video에서 최대 92%, 15% compression에서 87%, 50% compression에서 82%다. 처리 속도는 NVIDIA RTX 시스템에서 1080p video 기준 최단 22 milliseconds, NVIDIA L40 GPU에서 약 30 milliseconds로 제시됐다. Wowza는 이 microservice를 Video Intelligence Framework에 넣어 170개국 이상, 35,000개 이상 deployment가 있는 livestreaming 워크플로에 연결한다.
로컬 agent 스택도 같은 메시지를 낸다. DGX Station용 NVIDIA Agent Toolkit은 NemoClaw, Nemotron 3 Ultra, Omniverse libraries, OpenShell secure runtime을 한 시스템에 묶는다. Nemotron 3 Ultra는 550B open model로 설명됐고, DGX Station GB300 시스템은 최대 20 petaflops FP4 AI compute와 748GB coherent memory를 제공한다. 즉 제작자와 엔지니어가 자체 데이터와 3D 도구를 로컬 agent에게 연결할 수 있는 경로다.
다음 확인 지점은 벤치마크보다 현장 배포다. Cosmos 3 Edge는 Hugging Face와 GitHub에서 제공되지만, 실제 로봇 제어·공장 영상·뉴스룸 검증에서 latency, false positive, 운영비가 어떻게 나오는지가 이 발표의 무게를 결정한다.
관련 기사
NVIDIA Cosmos 3, 교통 영상 QA 정확도 54.41%에서 93.35%로 상승한 결과
NVIDIA가 Cosmos 3 Nano를 교통 안전 영상 QA에 맞춰 후처리해 정확도를 54.41%에서 93.35%까지 끌어올린 결과를 공개했다. agent가 LoRA와 AutoML을 실행한 점이 핵심이다.
NVIDIA Groq 3 LPX 양산 개시 — 에이전트 추론 속도 경쟁 플랫폼 대비 4배
NVIDIA가 Vera Rubin 플랫폼 확장형 추론 가속기 Groq 3 LPX의 양산을 8월 24일 선언했다. Gemma 4 31B 모델 기준 초당 3,400 토큰으로 역대 최고 추론 속도를 기록하며 에이전트 AI 인프라의 새 기준을 제시한다.
Anthropic, AI 에이전트로 실험실 장비 제어하는 MHS 표준 발표
Anthropic이 AI 에이전트가 현미경, 로봇 팔, 액체 핸들러 등 실험실·제조 장비를 안전하게 제어할 수 있는 표준 MHS(Model Hardware Standard)의 리서치 프리뷰를 공개했다. MCP의 물리 세계 버전으로, 장비 통합 작업을 수 주에서 수 시간으로 단축하는 것이 목표다.