RTX 3090에서 llama.cpp 대비 10배 빠른 프리필 오픈소스 PFlash 등장
Original: PFlash: 10x prefill speedup over llama.cpp at 128K on a RTX 3090 View original →
프리필 병목을 해결하다
긴 컨텍스트 LLM 추론에서 프리필 속도는 핵심 병목이다. Q4_K_M 양자화 Qwen3.6-27B 모델은 RTX 3090에서 디코딩은 ~74 토큰/초로 빠르지만, 프리필은 컨텍스트 길이에 따라 O(S²)로 급격히 느려진다. 131K 토큰 프롬프트에서 vanilla llama.cpp는 248.4초가 걸린다.
PFlash의 접근 방식
PFlash는 추측적 프리필(Speculative Prefill) 기법을 사용한다. 경량 드래프터 모델이 전체 프롬프트에서 토큰 중요도를 평가하고, 무거운 타깃 모델은 중요한 구간만 프리필하는 방식이다. Python, Triton, PyTorch 없이 C++/CUDA만으로 구현해 추론 루프의 오버헤드를 최소화했다.
실측 성능
- 128K 컨텍스트: 24.8초 vs llama.cpp 257초 = 10.4배 향상
- 64K 컨텍스트: 13.5초 vs llama.cpp 134.95초 = 10.0배 향상
NIAH(Needle In A Haystack) 검색 정확도도 end-to-end로 유지된다.
오픈소스, MIT 라이선스
레포지토리: github.com/Luce-Org/lucebox-hub. LocalLLaMA 커뮤니티에서 이미 많은 피드백이 쏟아지고 있으며, DFlash 추측적 디코딩과 결합한 사례도 공유되고 있다.
Related Articles
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
모델 라우터가 왜 결제 회사에 중요한가. 931점을 받은 논의는 단순한 인수 소식보다 inference 사용량의 측정·청구·정산을 한 흐름으로 묶을 가능성을 파고들었다.
Qwen3.5 출시 몇 주 뒤, r/LocalLLaMA는 general chat, coding, tool use에 맞는 sampler와 reasoning budget을 분리해 쓰는 방향으로 경험칙을 모으고 있다.