NVIDIA, CES 2026서 Rubin 플랫폼 공개...추론 비용 10배 절감
NVIDIA가 CES 2026에서 Rubin AI 플랫폼을 발표했다. Blackwell 대비 추론 토큰 비용을 10배 줄이고, MoE 모델 학습 GPU 수를 4배 감소시키는 획기적 성능 향상을 제시했다.
NVIDIA의 CEO Jensen Huang이 라스베이거스 CES 2026에서 차세대 AI 플랫폼 Rubin을 공개했다. Rubin은 NVIDIA의 첫 번째 익스트림 공동 설계(extreme-codesigned) AI 플랫폼으로, 이전 Blackwell 플랫폼 대비 획기적인 성능 개선을 제공한다.
핵심 성능
Rubin 플랫폼은 Blackwell 플랫폼과 비교해 다음과 같은 성능 향상을 제공한다:
- 추론 토큰 비용 10배 절감
- MoE(Mixture of Experts) 모델 학습에 필요한 GPU 수 4배 감소
이는 AI 모델 운영 및 학습 비용을 대폭 줄여, 기업들의 AI 도입 장벽을 낮출 것으로 기대된다.
6개 신규 칩, 단일 AI 슈퍼컴퓨터
NVIDIA는 Rubin 플랫폼의 일환으로 6개의 새로운 칩을 발표했으며, 이를 하나의 통합된 AI 슈퍼컴퓨터로 구성했다. NVIDIA 블로그는 "Rubin 플랫폼, 오픈 모델, 자율 주행: NVIDIA가 CES에서 제시하는 미래 청사진"이라는 제목으로 상세 내용을 공개했다.
RTX 4K AI 비디오 생성
NVIDIA는 CES에서 RTX를 통한 4K AI 비디오 생성 기능도 선보였다. LTX-2 및 ComfyUI 업그레이드를 통해 PC에서 고해상도 AI 비디오를 생성할 수 있게 되었다. 이는 크리에이터와 개발자들에게 강력한 도구를 제공한다.
시장 맥락
NVIDIA의 Rubin 발표는 AI 하드웨어 경쟁이 치열해지는 시점에 나왔다. Intel이 GPU 제조에 진출하고, Positron이 $230M 시리즈 B 펀딩으로 $1B 밸류에이션을 달성하는 등, NVIDIA의 독점적 지위에 도전하는 기업들이 늘어나고 있다.
그럼에도 NVIDIA는 기술 리더십을 유지하며, Rubin을 통해 "AI의 차세대"를 열어가고 있다.
관련 기사
NVIDIA Groq 3 LPX 양산 개시 — 에이전트 추론 속도 경쟁 플랫폼 대비 4배
NVIDIA가 Vera Rubin 플랫폼 확장형 추론 가속기 Groq 3 LPX의 양산을 8월 24일 선언했다. Gemma 4 31B 모델 기준 초당 3,400 토큰으로 역대 최고 추론 속도를 기록하며 에이전트 AI 인프라의 새 기준을 제시한다.
OpenAI 자체 추론 칩 '할라페뇨' 공개: Nvidia 대비 최대 3.6배 빠른 응답
OpenAI가 Broadcom과 공동 개발한 첫 자체 추론 칩 '할라페뇨'를 공개했다. Nvidia GB200·GB300 대비 처리량 최대 1.9배, 응답 지연 최대 3.6배 단축을 달성했으며 2026년 말 배포 예정이다.
NVIDIA Rubin CPX, 100만 토큰 처리 가능한 새로운 AI GPU 공개
NVIDIA가 대규모 컨텍스트 처리 전용 GPU Rubin CPX 발표. 소프트웨어 코딩과 생성형 비디오에서 100만 토큰 이상 처리 가능하며, 2026년 하반기 AWS, Google Cloud, Microsoft 등을 통해 제공 예정.