PyTorch, Blackwell용 Diffusers·TorchAO quantization으로 diffusion inference 가속 제시
PyTorch는 2026년 4월 8일 X에서 Diffusers와 TorchAO 기반 MXFP8/NVFP4 quantization이 NVIDIA B200에서 diffusion latency를 줄일 수 있다고 밝혔다. 동반 blog는 selective quantization과 regional compilation을 현실적인 latency-memory 최적화 조합으로 제시한다.
원문: Improve latency up to 1.68x with NVFP4 and MXFP8 using Diffusers and TorchAO on Blackwell across a suite of different models 🔥. Squeeze out maximum performance with recipes involving selective quantization and regional compilation. 🔗 Read our latest blog from @vkuzo (@Meta) and @RisingSayak (@HuggingFace): https://pytorch.org/blog/faster-diffusion-on-blackwell-mxfp8-and-nvfp4-with-diffusers-and-torchao/ #PyTorch #TorchAO #MXFP8 #NVFP4 #OpenSourceAI 원문 보기 →
PyTorch는 2026년 4월 8일 X post에서 Diffusers와 TorchAO를 이용해 NVIDIA B200 위에서 Flux.1-Dev, QwenImage, LTX-2의 end-to-end inference를 가속하는 새 blog를 소개했다. PyTorch 설명에 따르면 MXFP8은 최대 1.26배, NVFP4는 최대 1.68배의 speedup을 보였고, 일부 설정에서는 peak memory도 함께 낮췄다. 수치 자체도 중요하지만, image와 video generation workload에서 quantization이 실제 운영 가능한 recipe로 정리되기 시작했다는 점이 더 눈에 띈다.
핵심은 quantization 이름보다 조합 방식이다. 글은 selective quantization, torch.compile(fullgraph=True) 기반 regional compilation, CUDA Graphs를 함께 써서 latency를 낮췄고, bfloat16 baseline 대비 LPIPS를 측정해 quality drift를 관리했다고 설명한다. 또한 QwenImage가 Flux.1-Dev보다 quantization에 더 민감하다고 명시해, 모든 model에 동일한 low-precision 설정을 밀어 넣기 어렵다는 현실도 인정했다. 이는 Blackwell 최적화가 단순한 precision 전환이 아니라 model별 accuracy budget 관리 문제라는 뜻이기도 하다.
실무 관점에서 이번 포스트는 hardware 세대 교체보다 software stack tuning의 중요성을 더 강하게 보여준다. PyTorch는 NVFP4 kernel 개선을 위한 TorchAO 측 PR도 언급했는데, 이는 open-source inference stack이 아직 빠르게 진화하고 있음을 시사한다. diffusion workload를 운영하는 팀에게 이번 발표의 가치는 benchmark headline보다, 재현 가능한 tuning recipe와 accuracy trade-off 정보를 함께 제공했다는 데 있다.
관련 기사
NVIDIA 젠슨 황, GPT-6 Astra에 Blackwell 10만개 투입·40만개 추가 가동
프런티어 모델 경쟁의 규모가 10만 GPU 훈련에서 40만 GPU 증설 단계로 커지고 있다. NVIDIA CEO 젠슨 황은 GPT-6 Astra가 약 10만개 이상의 Grace Blackwell NVLink72에서 훈련됐으며, 다음으로 40만개 GPU가 가동될 것이라고 밝혔다.
264KB diffusion model, FPGA를 붙이자 3배 느려진 이유
가속기가 계산을 빠르게 해도 data가 도착하지 않으면 전체는 느려진다. r/MachineLearning의 이 작은 실험은 264KB SRAM에서 32×32 이미지를 만들며 memory wall을 숫자로 드러냈다.
NVIDIA, Hugging Face 129억3030만달러 인수…오픈 모델 플랫폼 독립성 유지
NVIDIA가 Hugging Face를 129억3030만달러에 인수하기로 합의하며 1,800만 개발자와 300만개 모델이 모인 오픈 AI 생태계를 품는다. 양사는 NVIDIA 하드웨어를 강제하지 않고 멀티클라우드·멀티가속기 중립성을 유지하겠다고 약속했으며, 규제 심사가 다음 변수다.