본문으로 건너뛰기

CoreWeave, Rubin GPU 72개·Vera CPU 36개 묶은 첫 NVL72 생산 랙 가동

CoreWeave가 72개 Rubin GPU와 36개 Vera CPU를 묶은 첫 양산형 NVL72 랙의 가동 준비에 들어갔다. 랙당 HBM4 20.7TB와 NVLink 대역폭 260TB/s를 제공해 Rubin이 사양표에서 실제 클라우드 인프라로 넘어가는 신호이며 상용 인스턴스 일정은 아직 공개되지 않았다.

원문: CoreWeave receives its first production NVIDIA Vera Rubin NVL72 racks 원문 보기 →

AI X/Twitter 작성자 Insights AI (Twitter) 2분 소요 출처

Rubin이 클라우드 데이터센터에 도착

CoreWeave가 NVIDIA Vera Rubin NVL72의 첫 양산형 랙을 인수하고 장비 기동 작업을 시작했다. 차세대 GPU의 공개나 샘플 시연이 아니라 실제 클라우드 사업자의 생산 데이터센터에 설치되는 단계로 넘어갔다는 의미다. CoreWeave는 NVIDIA와 Dell Technologies를 공급 파트너로 지목했고, 자사 엔지니어링팀과 데이터센터팀이 장비를 올리고 있다고 전했다.

“첫 양산형 NVIDIA Vera Rubin NVL72 랙을 받았다. 엔지니어링팀과 데이터센터팀이 장비 기동을 진행 중이다.” — CoreWeave 게시물 번역

NVL72 한 랙은 Rubin GPU 72개와 Vera CPU 36개를 결합한다. GPU 메모리는 HBM4 20.7TB, 메모리 대역폭은 최대 1,580TB/s이며, NVLink 6 스위치의 총 대역폭은 260TB/s다. 72개 GPU를 하나의 거대한 가속기처럼 연결하는 구성이어서 수조 개 매개변수 모델과 100만 토큰 문맥을 다루는 추론·훈련 작업을 겨냥한다. 랙 전체의 NVFP4 추론 성능은 예비 사양 기준 3,600PFLOPS다.

사양 경쟁에서 공급 경쟁으로

NVIDIA는 Vera Rubin NVL72가 이전 GB200 NVL72보다 100만 토큰당 추론 비용을 10분의 1로 줄이고, 같은 전력에서 토큰 처리량을 최대 10배 높인다고 제시한다. 혼합 전문가 모델 훈련에는 GPU를 4분의 1만 사용하며, 별도 Groq 3 LPX 랙과 결합하면 수조 매개변수 모델의 전력당 처리량이 최대 35배 높아진다는 주장도 내놨다. 모두 특정 모델과 입력·출력 길이를 사용한 공급사 측정치이므로 실제 워크로드에서 재검증이 필요하다.

CoreWeave 계정은 주로 GPU 클라우드 용량, 데이터센터 확장, 하드웨어 파트너십을 전한다. 이번 게시물에는 설치된 랙 수나 고객 서비스 개시일이 나오지 않았다. 따라서 ‘첫 랙 인수’는 대규모 상용 공급 완료가 아니라 생산 전환의 시작으로 보는 것이 맞다. 냉각, 전력, 네트워크를 함께 안정화한 뒤 고객이 사용할 수 있는 클러스터로 묶는 과정이 남아 있다. 초기 랙의 안정화 속도는 후속 물량과 예약 고객의 실제 사용 시점을 결정할 가능성이 크다. 공급량보다 운영 준비가 먼저 검증돼야 한다.

다음 확인점

앞으로 볼 것은 실제 서비스 지역, 가용 인스턴스 수, 시간당 가격, 그리고 Blackwell 대비 실측 토큰 처리량이다. 특히 72개 GPU를 연결하는 랙에서 장애가 발생했을 때 부분 가동과 핫스왑이 약속대로 작동하는지가 운영 경제성을 좌우한다. CoreWeave가 기동 완료 시점과 첫 고객 워크로드를 공개하면 Rubin 공급망의 속도를 가늠할 수 있다.

출처: CoreWeave 원문 게시물

공유: 긴글

관련 기사

AI X/Twitter

NVIDIA, Groq 3 LPX를 Vera Rubin용 low-latency inference rack으로 제시

NVIDIADC는 2026년 3월 17일 X에서 Groq 3 LPX를 Vera Rubin platform용 rack-scale low-latency inference accelerator로 소개했다. NVIDIA의 3월 16일 press release와 technical blog는 LPX가 256개의 LPU, 128GB on-chip SRAM, 640 TB/s scale-up bandwidth를 갖추고 Vera Rubin NVL72와 함께 agentic AI용 heterogeneous inference path를 형성한다고 설명한다.

2분 소요 49 조회