vLLM, FP8 장문맥 정확도 13%→89% 복구… KV-cache 실전 투입 벽 낮춘다
중요한 점은 FP8 추론이 품질 붕괴를 고칠 수 있어야만 값어치를 가진다는 데 있다. vLLM는 two-level accumulation 변경으로 128k needle-in-a-haystack 정확도를 13%에서 89%까지 끌어올리면서 FP8 decode 속도 이점은 유지했다고 적었다.
원문: vLLM restores FP8 long-context accuracy with a 13% to 89% jump 원문 보기 →
이번 벤치마크 숫자가 말하는 것
저정밀 추론의 약속은 단순하다. 더 싸고 더 빠르게 돌리되, model 품질은 무너지지 않아야 한다. vLLM는 FP8 KV-cache가 장문맥 작업에서 잃어버리던 정확도를 상당 부분 되돌리는 방법을 찾았다고 말한다. 프로젝트 X 글에서 유지보수 팀은 two-level accumulation fix 덕분에 128k needle-in-a-haystack 작업 성능이 13%에서 89%로 올라갔고, 그 와중에도 FP8 decode speedup은 지켰다고 적었다.
“two-level accumulation in FA3 takes 128k needle-in-a-haystack from 13% → 89%, while keeping the FP8 decode speedup”
vllm_project 계정은 가장 널리 쓰이는 open-source inference runtime 중 하나의 핵심 release 채널이다. 그래서 이런 글은 보통 마케팅 문구보다 실제로 배포 가능한 code path와 연결된다. 링크된 기술 글은 문제를 더 분명히 설명한다. 같은 128k 작업에서 BF16 baseline은 91%였지만, FP8 attention은 누적 계산 정밀도 문제 때문에 13%까지 무너졌다. 새 two-level accumulation 방식은 이 수치를 89%까지 되돌렸다. 장문맥 서비스에서 FP8을 다시 진지하게 검토할 만한 수준까지 올려놓은 셈이다.
왜 단순한 그래프 미화가 아닌가
이 글은 hybrid-attention model용 --kv-cache-dtype-skip-layers flag도 함께 언급한다. 이 지점이 중요하다. 실제 inference 운영은 깔끔한 실험 하나로 끝나지 않는다. 운영자는 양자화의 속도 이익을 유지하면서도 유난히 민감한 layer는 우회할 수 있는 손잡이가 필요하다. 그래서 이번 이야기는 예쁜 차트 하나가 아니라, vLLM가 잘 알려진 FP8 품질 실패를 실무에서 다룰 수 있는 engineering control로 바꾸고 있다는 데 있다.
다음 관전점은 재현성이다. 이 회복이 더 많은 model family, 특히 hybrid-attention과 MoE 계열에서도 유지되는지, 그리고 needle-in-a-haystack 류 평가를 넘어 실제 workload에서도 비슷한 품질 회복이 나오는지가 중요하다. 그 조건이 맞으면 FP8 KV-cache는 소수 전문가의 위험한 최적화가 아니라, 장문맥 추론의 보편적 배포 옵션으로 올라설 수 있다. 출처: vLLM source tweet · vLLM FP8 기술 글
관련 기사
vLLM speculative decoding, AMD GPU서 최대 2.87배…길게 예측한다고 빠를까
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
998달러로 3.8B LLM 훈련, CORE 점수보다 흥미로운 실패 기록
개인 개발자가 무작위 가중치에서 3.8B 모델을 훈련해 GPT-2의 CORE 점수를 넘어선 과정이 뜨거운 반응을 얻었다. 998달러라는 최종 비용도 눈길을 끌지만, context 길이 때문에 benchmark가 크게 왜곡된 분석이 더 실용적인 교훈을 남긴다.
OasisKV, 장문 LLM 서빙의 KV 메모리 6.5~9.7배 줄이고 처리량은 최대 2.1배로
KV 캐시 전체를 HBM에 두지 않는 OasisKV가 장문 LLM 서빙의 메모리 병목을 겨냥했다. 요청당 KV 요구량을 6.5~9.7배 줄이면서 다중 GPU 처리량을 최대 2.1배 높였다.