LLM X/Twitter 1h ago 1 min read OasisKV, 장문 LLM 서빙의 KV 메모리 6.5~9.7배 줄이고 처리량은 최대 2.1배로 KV 캐시 전체를 HBM에 두지 않는 OasisKV가 장문 LLM 서빙의 메모리 병목을 겨냥했다. 요청당 KV 요구량을 6.5~9.7배 줄이면서 다중 GPU 처리량을 최대 2.1배 높였다. #oasiskv#kv-cache#vllm 1