본문으로 건너뛰기
부식 중

Blackwell Ultra, DeepSeek-V3 학습서 GPU당 1,648 TFLOPs

AI 인프라 경쟁은 모델 크기만큼 학습 처리량 숫자로 움직인다. NVIDIA는 Blackwell Ultra가 DeepSeek-V3 671B 사전학습에서 GPU당 1,648 TFLOPs를 기록해 이전 세대 대비 약 3배 성능을 냈다고 밝혔다.

원문: NVIDIA Blackwell Ultra hits 1,648 TFLOPs per GPU on DeepSeek-V3 원문 보기 →

AI X/Twitter 작성자 Insights AI (Twitter) 1분 소요 19 조회 출처

대형 모델 학습 비용 경쟁에서 GPU당 처리량이 다시 전면에 섰다. NVIDIA AI는 Blackwell Ultra가 DeepSeek-V3 671B 사전학습에서 GPU당 1,648 TFLOPs를 기록하며 세계 기록을 세웠다고 밝혔다.

트윗의 핵심 수치는 “1,648 TFLOPs per GPU”와 “about 3x”였다.

NVIDIA AI 계정은 GPU, AI 프레임워크, 로보틱스, 인프라 최적화 소식을 주로 게시한다. 이번 게시물은 2026년 7월 21일 15:03 UTC에 올라왔고, 조회수는 약 9만 회였다. 첨부 이미지는 GB200 NVL72와 GB300 NVL72의 처리량을 비교하며 약 3배 증가를 보여준다.

중요한 이유는 DeepSeek-V3 671B가 MoE 구조의 대형 모델 학습 성능을 시험하는 강한 부하이기 때문이다. MoE는 라우팅, 통신, 메모리, 병렬화가 동시에 맞아야 성능이 나온다. NVIDIA는 Megatron-Core, TorchTitan, JAX 같은 프레임워크 전반의 소프트웨어 최적화와 하드웨어 공동 설계가 결과를 만들었다고 설명했다.

연결된 CoreWeave의 MLPerf Training v6.0 자료도 같은 흐름을 뒷받침한다. CoreWeave는 8,192개 NVIDIA Blackwell Ultra GPU로 DeepSeek-V3 671B 벤치마크를 2.02분에 수행했고, 4,096개 GPU에서는 3.09분, 2,048개 GPU에서는 5.54분을 기록했다고 밝혔다. 이 숫자는 단일 GPU 성능만이 아니라 네트워크, 스토리지, 스케줄링, 관측성까지 묶인 클러스터 운영 능력을 가리킨다.

다음 관전점은 이 처리량이 실제 고객 학습 작업에서 얼마나 유지되는지다. 벤치마크 기록은 강한 신호지만, 기업은 장애 복구, 데이터 파이프라인, 예약 대기시간, 장기 실행 비용까지 본다. 원문 트윗은 여기에서 확인할 수 있다.

공유: 긴글

관련 기사

AI

NVIDIA AVO, ARC-AGI-3 공개 벤치마크 전 183레벨 완파 — 에이전트 하네스가 모델 성능 3배 이상 증폭

NVIDIA의 자율 에이전트 시스템 AVO가 ARC-AGI-3 공개 벤치마크 전체 183개 레벨을 100% 완수했다. 기반 모델 Claude Opus 5의 30.2% 점수를 에이전트 하네스로 100%까지 끌어올려, 에이전트 아키텍처 설계가 모델 자체 성능보다 중요할 수 있음을 입증했다.

1분 소요 3 조회