Blackwell Ultra, DeepSeek-V3 학습서 GPU당 1,648 TFLOPs
Original: NVIDIA Blackwell Ultra hits 1,648 TFLOPs per GPU on DeepSeek-V3 View original →
대형 모델 학습 비용 경쟁에서 GPU당 처리량이 다시 전면에 섰다. NVIDIA AI는 Blackwell Ultra가 DeepSeek-V3 671B 사전학습에서 GPU당 1,648 TFLOPs를 기록하며 세계 기록을 세웠다고 밝혔다.
트윗의 핵심 수치는 “1,648 TFLOPs per GPU”와 “about 3x”였다.
NVIDIA AI 계정은 GPU, AI 프레임워크, 로보틱스, 인프라 최적화 소식을 주로 게시한다. 이번 게시물은 2026년 7월 21일 15:03 UTC에 올라왔고, 조회수는 약 9만 회였다. 첨부 이미지는 GB200 NVL72와 GB300 NVL72의 처리량을 비교하며 약 3배 증가를 보여준다.
중요한 이유는 DeepSeek-V3 671B가 MoE 구조의 대형 모델 학습 성능을 시험하는 강한 부하이기 때문이다. MoE는 라우팅, 통신, 메모리, 병렬화가 동시에 맞아야 성능이 나온다. NVIDIA는 Megatron-Core, TorchTitan, JAX 같은 프레임워크 전반의 소프트웨어 최적화와 하드웨어 공동 설계가 결과를 만들었다고 설명했다.
연결된 CoreWeave의 MLPerf Training v6.0 자료도 같은 흐름을 뒷받침한다. CoreWeave는 8,192개 NVIDIA Blackwell Ultra GPU로 DeepSeek-V3 671B 벤치마크를 2.02분에 수행했고, 4,096개 GPU에서는 3.09분, 2,048개 GPU에서는 5.54분을 기록했다고 밝혔다. 이 숫자는 단일 GPU 성능만이 아니라 네트워크, 스토리지, 스케줄링, 관측성까지 묶인 클러스터 운영 능력을 가리킨다.
다음 관전점은 이 처리량이 실제 고객 학습 작업에서 얼마나 유지되는지다. 벤치마크 기록은 강한 신호지만, 기업은 장애 복구, 데이터 파이프라인, 예약 대기시간, 장기 실행 비용까지 본다. 원문 트윗은 여기에서 확인할 수 있다.
Related Articles
NVIDIA가 Cosmos 3 Nano를 교통 안전 영상 QA에 맞춰 후처리해 정확도를 54.41%에서 93.35%까지 끌어올린 결과를 공개했다. agent가 LoRA와 AutoML을 실행한 점이 핵심이다.
NVIDIA Research의 MOTIVE는 video model fine-tuning에서 움직임에 실제로 기여하는 clip을 골라내는 방법이다. ICML 2026 Outstanding Paper Honorable Mention을 받았고, base model 대비 74.1% human preference를 기록했다.
영상 분석 파이프라인 구축이 코드 중심 작업에서 자연어 지시와 coding agent 조합으로 이동하고 있다. NVIDIA DeepStream 9.1은 13개 agentic skills와 JetPack 7.2 지원을 포함한다.