단종 Intel Optane으로 1조 파라미터 모델을 초당 4토큰에 구동
Original: Computer build using Intel Optane Persistent Memory - Can run 1 trillion parameter model at over 4 tokens/sec View original →
1조 파라미터 모델의 로컬 실행
r/LocalLLaMA 커뮤니티에서 한 사용자가 Intel Optane 영구 메모리(PMem)를 활용해 Kimi K2.5 1조 파라미터 모델을 초당 4토큰 이상으로 로컬 실행하는 데 성공한 빌드를 공개했다. 677점 이상을 기록하며 LLM 커뮤니티의 큰 관심을 끌었다.
Intel Optane이란
Intel Optane PMem은 DIMM 폼팩터의 메모리 모듈로, DRAM과 SSD의 중간 특성을 갖는다. Intel이 제품 라인을 단종시키면서 중고 시장에서 동급 DRAM 용량보다 훨씬 저렴하게 구입할 수 있게 됐다.
빌드 구성
이 사용자는 Optane PMem을 메모리 모드로 운용해 768GB의 유효 RAM 용량을 확보했다. Kimi K2.5의 혼합 전문가(MoE) 아키텍처를 활용해 llama.cpp의 하이브리드 GPU/CPU 추론을 구성했으며, 12GB GPU에 어텐션 가중치와 덴스 레이어를 배치했다.
의미
1조 파라미터 모델의 로컬 실행은 지금까지 데이터센터급 하드웨어가 필요한 영역이었다. 중고 Optane으로 이를 가능하게 한 이 빌드는 LLM 추론의 접근성 확장에 새로운 가능성을 보여준다.
Related Articles
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
r/LocalLLaMA의 한 글은 Qwen3.5 27B가 quality와 deployability 사이에서 드문 균형점을 만든다고 주장한다. 게시물은 RTX A6000 48GB, llama.cpp with CUDA, 32K context에서 약 19.7 tokens/sec를 보고했고, 댓글에서는 dense 27B와 35B-A3B MoE의 VRAM economics가 활발히 비교됐다.
LocalLLaMA가 반응한 이유는 새 모델 자랑이 아니라, --fit이 “VRAM에 다 들어가야 빠르다”는 체감 규칙을 흔들었기 때문이다.