vLLM speculative decoding, AMD GPU서 최대 2.87배…길게 예측한다고 빠를까
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
태그
#amd 태그가 달린 기사
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
유럽연합이 AI 연산 수요 부족을 메우기 위해 Bull에 3억8,780만 유로 규모 LUMI-AI 구축을 맡겼다. NVIDIA가 아닌 AMD AI 칩을 채택한 이 시스템은 핀란드에서 2027년 하반기 가동되며, 유럽 AI Factory 네트워크의 여섯 번째 신규 슈퍼컴퓨터가 된다.
AMD가 Hot Chips 2026에서 CDNA 5 기반 MI455X를 공개했다. HBM4 432GB, 23.3TB/s 대역폭, FP4 기준 40PFLOPS로 이전 세대 대비 메모리 용량 1.5배, 대역폭 2.9배 향상. Helios 랙은 2026년 3분기 출하 예정.
로컬 LLM 관심은 이제 “돌아가나”에서 “두 노드를 어떻게 한 기계처럼 묶나”로 옮겨갔다. 이 가이드는 Framework Strix Halo 보드 두 대와 Intel E810 RoCE v2 구성을 vLLM serving까지 연결한다.
RX 9070 XT와 Windows 11 25H2 환경에서 Advanced Shader Delivery를 켜면 Forza Horizon 6 초기 로딩이 48초에서 2초로 줄었다. r/pcgaming에서는 1% low 개선과 Xbox/Microsoft Store 한정 지원 범위를 두고 논의가 이어졌다.
AMD가 FSR(FidelityFX Super Resolution) 업스케일링 4.1을 Radeon RX 7000 시리즈에 2026년 7월 공식 지원한다고 발표했다. RX 6000 시리즈 지원은 2027년 예정이다.
AMD Ryzen AI Max Pro 495(코드명 Gorgon Halo)가 192GB 통합 메모리를 탑재한 것으로 유출됐다. 기존 Strix Halo의 128GB에서 50% 늘어난 용량으로, 더 큰 AI 모델을 로컬에서 구동할 수 있게 된다.
LocalLLaMA가 Hipfire에 몰린 이유는 새 repo 하나가 아니라 RDNA 사용자들이 오래 기다린 “우리 쪽 최적화”에 가까웠기 때문이다. 댓글도 곧바로 실제 카드에서 나온 속도 수치와 호환성 질문으로 채워졌다.
Hacker News front page에 오른 EE Times 인터뷰는 AMD가 ROCm, Triton, OneROCm, open-source 전략으로 CUDA 의존도를 단계적으로 낮추려는 접근을 정리한다. 핵심은 화려한 호환성 선언보다 vLLM과 SGLang이 자연스럽게 돌아가는 boring한 software 완성도다.
LocalLLaMA 커뮤니티는 2026년 3월 11일 공개된 FastFlowLM·Lemonade 업데이트를 통해 AMD XDNA 2 NPU의 Linux 지원 경로가 구체화됐다고 평가했다.
r/Games 게시글은 Xbox Wire의 March 11 GDC 업데이트를 부각시켰다. Xbox는 Project Helix를 AMD와 공동 설계 중이며, 2027년 개발자용 alpha 하드웨어와 April Windows 11용 Xbox Mode rollout 계획을 밝혔다.
Meta는 AMD와의 장기 계약을 통해 최대 6GW 규모의 AMD Instinct GPU 용량을 확보한다고 밝혔다. 첫 출하는 2026년 하반기 Helios rack-scale 시스템에서 시작될 예정이다.