LLM Hacker News Feb 21, 2026 1 min read HN 주목: CDLM이 제시한 블록 단위 KV 캐시와 스텝 축소로 확산형 LLM 추론 가속 Hacker News 고득점 스레드는 Together AI의 CDLM 글을 공유했다. 해당 글은 확산형 언어모델에서 trajectory-consistent step reduction과 exact block-wise KV caching을 결합해 최대 14.5배 지연시간 개선을 보고한다. #diffusion-language-models#llm-inference#kv-cache 25