DynoSim, 2.41초에 60.1분 추론 트래픽을 재현한 NVIDIA의 배치 탐색 방식
NVIDIA가 Dynamo serving stack을 빠르게 실험하는 DynoSim을 공개했다. 기술 블로그 기준 Apple M4 MacBook Air에서 23,608개 요청, 60.1분 분량 트래픽을 2.41초에 재현해 약 1,500배 빠른 시뮬레이션을 보였다.
태그
#nvidia 태그가 달린 기사
NVIDIA가 Dynamo serving stack을 빠르게 실험하는 DynoSim을 공개했다. 기술 블로그 기준 Apple M4 MacBook Air에서 23,608개 요청, 60.1분 분량 트래픽을 2.41초에 재현해 약 1,500배 빠른 시뮬레이션을 보였다.
LLM inference 운영에서 비싼 GPU 실험을 먼저 돌릴 필요가 줄어든다. NVIDIA DynoSim은 23,608개 request trace를 Apple M4 MacBook Air에서 2.41초에 재생하며 real time 대비 약 1,500배 빠른 serving simulation을 제시했다.
NVIDIA 연구팀이 최대 1분 길이의 720p 해상도 영상을 생성할 수 있는 2.6B 파라미터 오픈소스 월드 모델 SANA-WM을 공개했다. 상대적으로 작은 모델 크기와 오픈소스 공개가 특징이다.
Anthropic이 2026년 5월 6일 SpaceX-xAI의 콜로서스1 데이터센터 전체 컴퓨팅을 독점 임차하는 계약을 체결했다. NVIDIA GPU 22만 개, 300MW 규모로 Claude API 한도가 대폭 상향된다.
NVIDIA AI가 하나의 체크포인트에 30B, 23B, 12B 추론 모델을 담은 Star Elastic을 공개했다. 제로샷 슬라이싱으로 별도 다운로드 없이 모델 크기를 동적으로 조정할 수 있다.
미 국방부가 5월 1일 Amazon, Google, Microsoft, NVIDIA, OpenAI, SpaceX, Reflection AI와 기밀 군사 네트워크 AI 배포 협약을 체결했다. 안전 가드레일을 주장한 Anthropic은 명단에서 빠졌다.
미 국방부가 OpenAI·구글·마이크로소프트 등 8개사와 최고 기밀 분류 네트워크에서의 AI 배포 협정을 체결했다. 앤트로픽은 군사적 활용 제한 조항을 둘러싼 분쟁으로 유일하게 제외됐다.
LocalLLaMA 유저가 NVIDIA DGX Spark 16대를 200Gbps 패브릭으로 연결한 클러스터 구축을 완료했다. 통합 메모리 극대화를 목표로 DeepSeek, Kimi 등 대형 모델 서빙을 테스트 중이다.
멀티모달 에이전트의 병목은 정확도보다 처리량이다. NVIDIA Nemotron 3 Nano Omni는 최대 9배 높은 처리량, 256K 컨텍스트, 6개 리더보드 1위를 앞세워 그 병목을 정면으로 겨냥했다.
스웨덴 법률 AI 스타트업 Legora가 Nvidia NVentures, Atlassian이 참여한 시리즈 D를 6억 달러로 마감, 기업가치 56억 달러를 달성했다. ARR 1억 달러를 돌파하며 Harvey와 정면 경쟁 구도를 형성했다.
멀티모달 에이전트는 아직 비전·오디오·텍스트 모델을 따로 엮느라 비용과 지연을 치른다. NVIDIA는 Nemotron 3 Nano Omni로 30B 파라미터, 256K 문맥, 동일 반응성 기준 영상 추론 시스템 용량 최대 9.2배를 내세웠다.
이번 소식의 핵심은 또 하나의 클라우드 제휴가 아니다. NVIDIA와 Google Cloud는 A5X Rubin 시스템이 단일 사이트 8만개, 멀티사이트 96만개 GPU까지 확장될 수 있고, 이전 세대 대비 토큰당 추론 비용과 전력당 처리량이 각각 최대 10배 개선된다고 밝혔다.