12GB VRAM으로 Qwen3.6 35B 모델 초당 80 토큰 달성
Original: 80 tok/sec and 128K context on 12GB VRAM with Qwen3.6 35B A3B and llama.cpp MTP View original →
주목할 만한 성과
로컬 LLM 커뮤니티 r/LocalLLaMA에서 12GB VRAM GPU 사용자가 Qwen3.6 35B A3B 모델을 초당 80토큰 이상의 속도로 구동하는 설정을 공개해 큰 반응을 얻었다. 35B 파라미터 모델을 소비자급 그래픽 카드로 이 속도로 실행한다는 것은 불과 몇 달 전만 해도 어려운 일이었다.
핵심 기술: llama.cpp MTP
이 성과의 핵심은 llama.cpp의 MTP(Multi-Token Prediction) 기능이다. MTP는 드래프트 모델이 여러 토큰을 미리 예측하면 메인 모델이 배치로 검증하는 방식으로, 80% 이상의 드래프트 수락률을 달성했다. 출력 품질을 유지하면서 실질적인 처리 속도를 크게 높인다.
설정 요약
- 모델: Qwen3.6 35B A3B (양자화 버전)
- 컨텍스트: 128K 토큰
- 속도: 80+ 토큰/초
- 드래프트 수락률: 80%+
- 필요 VRAM: 12GB
의미
12GB VRAM은 RTX 3060~4070 수준의 일반 소비자 GPU다. 이 등급 하드웨어로 35B 모델을 실용적인 속도로 구동할 수 있게 됐다는 것은 로컬 AI 민주화 측면에서 의미 있는 진전이다.
Related Articles
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
r/LocalLLaMA의 한 글은 Qwen3.5 27B가 quality와 deployability 사이에서 드문 균형점을 만든다고 주장한다. 게시물은 RTX A6000 48GB, llama.cpp with CUDA, 32K context에서 약 19.7 tokens/sec를 보고했고, 댓글에서는 dense 27B와 35B-A3B MoE의 VRAM economics가 활발히 비교됐다.
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.