2026년 3월 14일 LocalLLaMA 글은 SM120 Blackwell 워크스테이션용 CUTLASS·FlashInfer 패치를 소개하며, Qwen3.5-397B NVFP4 추론 속도 개선과 FlashInfer PR #2786을 함께 제시했다.
#blackwell
RSS 피드r/LocalLLaMA에서 주목받은 FlashAttention-4는 B200 BF16에서 최대 1605 TFLOPs/s를 제시하며, Blackwell의 메모리·SFU 병목을 겨냥한 파이프라인 개선을 소개했다.
NVIDIA는 2026년 2월 12일, Baseten·DeepInfra·Fireworks AI·Together AI가 Blackwell 기반 추론 스택으로 token cost를 크게 낮추고 있다고 밝혔다. 발표에는 Hopper 대비 최대 10배 절감, 개별 고객사별 지연시간·비용 개선 수치가 포함됐다.
NVIDIA는 2026년 2월 18일 인도 AI Impact Summit에서 IndiaAI Mission과 연계한 협력 현황을 공개했다. 핵심은 10억 달러 이상이 투입되는 국가 AI 계획에 맞춰 GPU 인프라, 주권형 모델 개발, 연구·스타트업 생태계를 동시에 확대하는 것이다.
NVIDIA는 2026년 2월 17일 Meta가 GB300 NVL72, RTX PRO 서버, Spectrum-X, Mission Control을 포함한 스택으로 AI 인프라를 확장한다고 발표했다. 대규모 Hopper 배치 경험 위에 Blackwell 기반 전환을 본격화하는 흐름이다.
NVIDIA는 2026년 2월 16일 Blackwell Ultra(GB300 NVL72) 기반 추론 지표를 공개하며, Hopper 대비 최대 50배 throughput-per-megawatt와 최대 35배 토큰 비용 절감을 제시했다. Microsoft, CoreWeave, OCI의 GB300 NVL72 배치 사례도 함께 공개했다.
NVIDIA가 로봇 공학을 위한 새로운 오픈 모델과 Blackwell 기반 Jetson T4000 모듈을 발표했습니다. Boston Dynamics, NEURA Robotics 등 글로벌 기업들이 NVIDIA 로봇 스택을 채택했습니다.