PyTorch, Blackwell용 Diffusers·TorchAO quantization으로 diffusion inference 가속 제시
Original: Improve latency up to 1.68x with NVFP4 and MXFP8 using Diffusers and TorchAO on Blackwell across a suite of different models 🔥. Squeeze out maximum performance with recipes involving selective quantization and regional compilation. 🔗 Read our latest blog from @vkuzo (@Meta) and @RisingSayak (@HuggingFace): https://pytorch.org/blog/faster-diffusion-on-blackwell-mxfp8-and-nvfp4-with-diffusers-and-torchao/ #PyTorch #TorchAO #MXFP8 #NVFP4 #OpenSourceAI View original →
PyTorch는 2026년 4월 8일 X post에서 Diffusers와 TorchAO를 이용해 NVIDIA B200 위에서 Flux.1-Dev, QwenImage, LTX-2의 end-to-end inference를 가속하는 새 blog를 소개했다. PyTorch 설명에 따르면 MXFP8은 최대 1.26배, NVFP4는 최대 1.68배의 speedup을 보였고, 일부 설정에서는 peak memory도 함께 낮췄다. 수치 자체도 중요하지만, image와 video generation workload에서 quantization이 실제 운영 가능한 recipe로 정리되기 시작했다는 점이 더 눈에 띈다.
핵심은 quantization 이름보다 조합 방식이다. 글은 selective quantization, torch.compile(fullgraph=True) 기반 regional compilation, CUDA Graphs를 함께 써서 latency를 낮췄고, bfloat16 baseline 대비 LPIPS를 측정해 quality drift를 관리했다고 설명한다. 또한 QwenImage가 Flux.1-Dev보다 quantization에 더 민감하다고 명시해, 모든 model에 동일한 low-precision 설정을 밀어 넣기 어렵다는 현실도 인정했다. 이는 Blackwell 최적화가 단순한 precision 전환이 아니라 model별 accuracy budget 관리 문제라는 뜻이기도 하다.
실무 관점에서 이번 포스트는 hardware 세대 교체보다 software stack tuning의 중요성을 더 강하게 보여준다. PyTorch는 NVFP4 kernel 개선을 위한 TorchAO 측 PR도 언급했는데, 이는 open-source inference stack이 아직 빠르게 진화하고 있음을 시사한다. diffusion workload를 운영하는 팀에게 이번 발표의 가치는 benchmark headline보다, 재현 가능한 tuning recipe와 accuracy trade-off 정보를 함께 제공했다는 데 있다.
Related Articles
AI 인프라 경쟁은 모델 크기만큼 학습 처리량 숫자로 움직인다. NVIDIA는 Blackwell Ultra가 DeepSeek-V3 671B 사전학습에서 GPU당 1,648 TFLOPs를 기록해 이전 세대 대비 약 3배 성능을 냈다고 밝혔다.
Google Research가 diffusion model이 학습 데이터를 베끼지 않고 새 샘플을 만드는 이유를 score smoothing으로 설명했다. ICLR 2026 논문과 코드가 함께 공개돼, 생성형 AI의 memorization 논쟁을 더 정밀하게 다룰 근거가 생겼다.
평가용으로 안전장치를 낮춘 모델이 Hugging Face 보안 사고와 연결됐다는 공개 설명에 관심이 모였다. 논점은 단순한 침해 사실보다, cyber benchmark가 실제 인프라와 만날 때 통제 경계가 어디까지 버티는가다.