본문으로 건너뛰기

OasisKV, 장문 LLM 서빙의 KV 메모리 6.5~9.7배 줄이고 처리량은 최대 2.1배로

Original: OasisKV cuts KV memory needs 6.5-9.7x, lifts throughput up to 2.1x View original →

Read in other languages: English日本語
LLM Aug 17, 2026 By Insights AI (Twitter) 1 min read 1 views Source
OasisKV, 장문 LLM 서빙의 KV 메모리 6.5~9.7배 줄이고 처리량은 최대 2.1배로

HBM 밖의 KV 캐시를 미리 불러오는 방식

긴 컨텍스트와 장문 추론이 늘면서 LLM 서빙의 병목은 연산보다 메모리로 이동하고 있다. OasisKV는 디코딩 중 전체 KV 캐시를 GPU의 HBM에 유지하지 않는다. 대신 다음 토큰들이 주목할 가능성이 높은 KV 블록을 예측해 호스트 또는 원격 메모리에서 미리 가져오고, 실제 attention 계산 직전에 HBM에 올린다. 연구진은 vLLM 기반 구현에서 추론 작업 처리량을 1.69배, 다중 GPU 장문 서빙 처리량을 최대 2.1배 높였다고 보고했다.

“중요한 KV 토큰을 칩 밖 메모리에서 미리 가져와 HBM 압력을 낮추고 처리량을 최대 2.1배 높인다.” — DailyPapers 게시물

예측에는 speculative decoding이 만든 lookahead token을 활용한다. 백그라운드 attention 파이프라인이 앞으로 중요해질 KV 블록을 골라내면, 시스템은 다음 디코드 단계가 시작되기 전에 해당 블록을 더 큰 메모리 계층에서 가져온다. 디코딩 시 attention이 모든 과거 토큰에 같은 비중을 두지 않는 희소성을, HBM 용량 절감과 처리량 향상으로 바꾸는 접근이다.

정확도 손실과 메모리 절감의 조건

2,048-token KV 예산에서 full attention 대비 정확도 차이는 0.7점 이내였다. 추론 작업에서는 정확도 0.1점 손실 조건으로 dense vLLM보다 1.69배 높은 처리량을 기록했다. 다중 GPU 장문 서빙에서는 최대 2.1배에 도달했다. prefill과 decode를 분리한 구성에서는 dense 방식의 약 2배 처리량을 내면서 요청당 KV 요구량을 6.5~9.7배, decode node의 호스트 메모리 사용량을 2.2~2.6배 줄였다.

이 수치들은 서로 다른 작업과 배치 조건에서 얻은 결과이므로 하나의 보편적 배수로 합쳐서는 안 된다. DailyPapers는 Hugging Face Papers에 등록된 연구를 선별해 알리는 계정이며, 이번 게시물은 2026년 8월 8일 제출된 OasisKV arXiv 논문을 요약했다. 논문은 구체적인 정확도 차이를 제시하므로 게시물의 “정확도 손실 없음” 표현보다 조건을 좁혀 이해하는 편이 안전하다.

실제 서빙에서 확인할 항목

다음 단계는 GPU 세대와 인터커넥트, 호스트 메모리 대역폭, 요청 길이 분포가 달라져도 prefetch가 제때 끝나는지 확인하는 일이다. 중요 토큰 예측이 빗나갈 때 생기는 지연과 정확도 변화, speculative decoding 자체의 비용, 짧은 요청이 많은 환경에서의 손익도 필요하다. 결과가 다양한 모델과 하드웨어에서 재현되면, 비싼 HBM을 계속 늘리는 대신 KV 캐시를 계층형 메모리로 운영하는 선택지가 현실적인 서빙 최적화로 자리 잡을 수 있다. 출처 게시물은 X에서 확인할 수 있다.

Share: Long

Related Articles

LLM Reddit Mar 28, 2026 2 min read

2026년 3월 26일 Google Cloud B200 cluster에서 Qwen 3.5 27B를 서빙한 사례를 다룬 r/LocalLLaMA 글은 크롤링 시점 기준 205 points와 52 comments를 기록했다. 링크된 글은 tensor parallelism에서 data parallelism으로 바꾸고, context length를 줄이며, FP8 KV cache와 MTP-1 speculative decoding을 적용해 12 node에서 총 1,103,941 tokens per second를 달성했다고 설명한다.