r/LocalLLaMA가 주목한 TurboQuant on MLX, KV cache compression이 FP16 speed에 근접
r/LocalLLaMA에서 주목받은 March 28, 2026 게시물은 TurboQuant KV cache compression을 MLX와 custom Metal kernel에 이식한 구현 기록이다. 작성자는 Qwen2.5-32B on M4 Pro 48GB에서 4.6x compression과 0.98x FP16 speed를 주장했지만, repo README의 7B 수치는 더 보수적이어서 실제 이득이 model과 integration 방식에 크게 좌우된다는 점도 함께 드러난다.
원문: TurboQuant on MLX: 4.6x KV cache compression with custom Metal kernels (Qwen 32B at 98% FP16 speed) 원문 보기 →
왜 r/LocalLLaMA가 반응했는가
March 28, 2026에 traction을 얻은 r/LocalLLaMA 게시물은 단순한 paper 공유가 아니었다. 작성자는 TurboQuant 계열 KV cache compression을 MLX에 이식하고, custom Metal kernel과 함께 code, writeup, 그리고 upstream PR까지 공개했다. 이 차이가 중요하다. LocalLLaMA community가 원하는 것은 abstract한 long-context efficiency claim이 아니라, Apple Silicon 위의 실제 local inference stack에서 살아남는 구현이기 때문이다.
Reddit 게시물과 Medium writeup은 Qwen2.5-32B를 M4 Pro 48GB에서 돌렸을 때 4.6x KV cache compression, 0.98x FP16 speed, 그리고 16K context 기준 4.2GB에서 897MB로 내려가는 memory 절감을 제시한다. 작성자 설명에 따르면 병목은 이론보다 구현에 더 가까웠다. fused Metal quantize/dequantize kernel, full cache를 매 decode step마다 다시 풀지 않게 하는 incremental decode buffer, 그리고 Python 대신 GPU 안에서 bit extraction을 처리한 점이 핵심 최적화였다. 그 결과 속도는 0.28x FP16 수준에서 거의 parity까지 올라갔다.
어디까지 믿어야 하나
기반이 되는 TurboQuant 논문은 분명 기술적으로 흥미롭다. randomized rotation과 quantization을 결합해 distortion를 줄이면서 vector를 압축하고, KV cache에 대해서도 3.5 bits per channel 부근에서 quality neutrality에 가깝다고 주장한다. 다만 shipping 관점에서는 이야기가 더 복잡하다. repo README에는 7B model의 layer-adaptive mode에서 1.9x에서 2.4x compression, 그리고 FP16보다 낮은 속도가 적혀 있다. 이것은 Reddit 결과를 부정한다기보다, model size, layer sensitivity, implementation detail이 실제 체감 이득을 크게 바꾼다는 뜻에 가깝다.
바로 그 점 때문에 이 게시물이 community에서 먹혔다. LocalLLaMA 사용자들은 clever한 paper 자체보다, consumer hardware에서 longer context를 현실적으로 늘려 줄 경로를 원한다. 다음 관전 포인트는 mlx-lm PR이 실제로 upstream에 반영되는지, 그리고 broader한 perplexity 혹은 needle-in-a-haystack benchmark가 headline number를 지지하는지다. 그 검증이 따라온다면, TurboQuant on MLX는 2026년 Apple Silicon local LLM inference에서 꽤 실용적인 upgrade 후보가 될 수 있다.
관련 기사
LocalLLaMA, Apple Silicon에서 DFlash로 Qwen 추론 2~3배 가속 보고
LocalLLaMA의 한 구현 보고는 Apple Silicon용 native MLX DFlash runtime으로 Qwen 계열 inference를 2배에서 3배 이상 가속했다고 주장한다. 중요한 점은 speedup뿐 아니라 greedy baseline과 bit-for-bit identical output을 유지했다고 설명한 부분이다.
Reddit, Mac용 Qwen 3.5 llama.cpp Metal speedup를 주목하다
r/LocalLLaMA 게시글은 Mac 사용자를 March 11, 2026에 merge된 llama.cpp pull request #20361로 이끌었다. 이 PR은 fused GDN recurrent Metal kernel을 추가하며, Qwen 3.5 계열에서 대략 12-36% throughput 향상을 제시한다. Reddit commenters는 change가 master에는 들어갔지만 일부 local benchmark에서는 여전히 MLX가 더 빠를 수 있다고 덧붙였다.
r/LocalLLaMA가 추적한 Apple Silicon용 DFlash: MLX에서 lossless speculative decoding 4.1x
r/LocalLLaMA의 새 글은 M5 Max와 MLX 0.31.1 환경에서 DFlash speculative decoding을 공개하고, Qwen3.5-9B에서 127.07 tok/s와 4.13x speedup을 보고했다. 중요한 점은 headline보다 재현 조건과 bandwidth bottleneck 해석이 구체적이라는 데 있다.