본문으로 건너뛰기

Blackwell Ultra, DeepSeek-V3 학습서 GPU당 1,648 TFLOPs

Original: NVIDIA Blackwell Ultra hits 1,648 TFLOPs per GPU on DeepSeek-V3 View original →

Read in other languages: English日本語
AI Jul 22, 2026 By Insights AI (Twitter) 1 min read Source
Blackwell Ultra, DeepSeek-V3 학습서 GPU당 1,648 TFLOPs

대형 모델 학습 비용 경쟁에서 GPU당 처리량이 다시 전면에 섰다. NVIDIA AI는 Blackwell Ultra가 DeepSeek-V3 671B 사전학습에서 GPU당 1,648 TFLOPs를 기록하며 세계 기록을 세웠다고 밝혔다.

트윗의 핵심 수치는 “1,648 TFLOPs per GPU”와 “about 3x”였다.

NVIDIA AI 계정은 GPU, AI 프레임워크, 로보틱스, 인프라 최적화 소식을 주로 게시한다. 이번 게시물은 2026년 7월 21일 15:03 UTC에 올라왔고, 조회수는 약 9만 회였다. 첨부 이미지는 GB200 NVL72와 GB300 NVL72의 처리량을 비교하며 약 3배 증가를 보여준다.

중요한 이유는 DeepSeek-V3 671B가 MoE 구조의 대형 모델 학습 성능을 시험하는 강한 부하이기 때문이다. MoE는 라우팅, 통신, 메모리, 병렬화가 동시에 맞아야 성능이 나온다. NVIDIA는 Megatron-Core, TorchTitan, JAX 같은 프레임워크 전반의 소프트웨어 최적화와 하드웨어 공동 설계가 결과를 만들었다고 설명했다.

연결된 CoreWeave의 MLPerf Training v6.0 자료도 같은 흐름을 뒷받침한다. CoreWeave는 8,192개 NVIDIA Blackwell Ultra GPU로 DeepSeek-V3 671B 벤치마크를 2.02분에 수행했고, 4,096개 GPU에서는 3.09분, 2,048개 GPU에서는 5.54분을 기록했다고 밝혔다. 이 숫자는 단일 GPU 성능만이 아니라 네트워크, 스토리지, 스케줄링, 관측성까지 묶인 클러스터 운영 능력을 가리킨다.

다음 관전점은 이 처리량이 실제 고객 학습 작업에서 얼마나 유지되는지다. 벤치마크 기록은 강한 신호지만, 기업은 장애 복구, 데이터 파이프라인, 예약 대기시간, 장기 실행 비용까지 본다. 원문 트윗은 여기에서 확인할 수 있다.

Share: Long

Related Articles