NVIDIA, GPU DRA Driver를 Kubernetes community에 기증
NVIDIA는 KubeCon Europe에서 GPU Dynamic Resource Allocation driver를 CNCF와 upstream Kubernetes ecosystem으로 넘긴다고 밝혔다. 이번 발표는 confidential containers, KAI Scheduler, Grove API까지 묶어 대규모 AI cluster 운영 표준을 넓히려는 시도로 읽힌다.
원문: Advancing Open Source AI, NVIDIA Donates Dynamic Resource Allocation Driver for GPUs to Kubernetes Community 원문 보기 →
NVIDIA는 2026년 3월 24일 KubeCon Europe에서 중요한 infrastructure 발표를 내놨다. GPU용 NVIDIA Dynamic Resource Allocation(DRA) Driver를 Cloud Native Computing Foundation에 기증하겠다는 것이다. 실질적으로는 GPU orchestration의 핵심 소프트웨어 일부를 vendor 단독 통제에서 Kubernetes community 중심의 공동 거버넌스로 옮기겠다는 의미다.
이 발표가 중요한 이유는 Kubernetes가 이미 많은 enterprise AI workload의 기본 control plane이 됐기 때문이다. model training과 inference가 container 환경으로 더 많이 이동할수록 GPU 관리는 단순한 hardware 배치 문제가 아니라, cluster 단위의 scheduling, isolation, resource sharing 문제로 바뀐다. NVIDIA는 DRA Driver를 이 계층을 더 투명하고 더 programmable하게 만드는 표준 인터페이스로 밀고 있다.
NVIDIA가 강조한 개선 포인트
- NVIDIA Multi-Process Service와 Multi-Instance GPU를 활용한 더 정교한 GPU 공유
- NVIDIA Multi-Node NVlink 같은 multi-node interconnect 구성을 native하게 지원하는 확장성
- workload 변화에 따라 hardware allocation을 동적으로 다시 구성할 수 있는 유연성
- compute, memory, interconnect 조건을 더 세밀하게 지정할 수 있는 정밀한 요청 방식
NVIDIA는 이번 기증을 open AI infrastructure 확대 전략과도 연결했다. 회사는 CNCF Confidential Containers community와 함께 Kata Containers에 GPU support를 추가했다고 밝혔고, 이를 통해 GPU 가속 workload에도 confidential computing 수준의 격리를 적용할 수 있다고 설명했다. 또한 KAI Scheduler가 CNCF Sandbox 단계에 들어갔고, GPU cluster용 AI workload orchestration API인 Grove가 llm-d inference stack과 통합되고 있다고 덧붙였다.
협력사 범위도 눈에 띈다. NVIDIA는 AWS, Broadcom, Canonical, Google Cloud, Microsoft, Nutanix, Red Hat, SUSE가 관련 기능을 함께 밀고 있다고 밝혔다. 이것이 곧바로 Kubernetes 기반 AI 운영을 단순하게 만들지는 않겠지만, 적어도 GPU orchestration 패턴이 proprietary tooling에 갇히지 않고 vendor 간 공통 표준으로 수렴할 가능성은 높아진다.
AI platform 팀 관점에서 보면 이번 뉴스의 핵심은 단일 driver 자체보다 거버넌스 변화다. 핵심 GPU scheduling 구성요소가 vendor-neutral foundation으로 옮겨가면 운영자, 연구자, software vendor가 같은 인터페이스 위에서 도구를 쌓기 쉬워진다. AI cluster 규모가 빠르게 커지고 infrastructure 복잡성이 계속 높아지는 시장에서 이런 표준화는 raw silicon 성능만큼 중요한 경쟁력이 될 수 있다. 원문: NVIDIA Blog.
관련 기사
NVIDIA, Hugging Face 129억3030만달러 인수…오픈 모델 플랫폼 독립성 유지
NVIDIA가 Hugging Face를 129억3030만달러에 인수하기로 합의하며 1,800만 개발자와 300만개 모델이 모인 오픈 AI 생태계를 품는다. 양사는 NVIDIA 하드웨어를 강제하지 않고 멀티클라우드·멀티가속기 중립성을 유지하겠다고 약속했으며, 규제 심사가 다음 변수다.
NVIDIA 젠슨 황, GPT-6 Astra에 Blackwell 10만개 투입·40만개 추가 가동
프런티어 모델 경쟁의 규모가 10만 GPU 훈련에서 40만 GPU 증설 단계로 커지고 있다. NVIDIA CEO 젠슨 황은 GPT-6 Astra가 약 10만개 이상의 Grace Blackwell NVLink72에서 훈련됐으며, 다음으로 40만개 GPU가 가동될 것이라고 밝혔다.
CoreWeave, Rubin GPU 72개·Vera CPU 36개 묶은 첫 NVL72 생산 랙 가동
CoreWeave가 72개 Rubin GPU와 36개 Vera CPU를 묶은 첫 양산형 NVL72 랙의 가동 준비에 들어갔다. 랙당 HBM4 20.7TB와 NVLink 대역폭 260TB/s를 제공해 Rubin이 사양표에서 실제 클라우드 인프라로 넘어가는 신호이며 상용 인스턴스 일정은 아직 공개되지 않았다.