104GB Qwen을 48GB Mac에서 12 tok/s로, slotstream의 SSD 승부
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.
원문: Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s 원문 보기 →
Qwen3.8-Flash-Next의 4-bit weight는 104GB다. slotstream은 이 125B mixture-of-experts 모델을 메모리에 전부 올리지 않고, 토큰마다 필요한 expert를 SSD에서 읽어 Apple Silicon에서 실행한다. 48GB M5 Pro 실측 기준으로 warm decode는 약 12 tok/s, peak memory는 32GB, engine 시작은 약 2초다. 처음에는 3.8GB짜리 공통 trunk만 적재한다.
MoE의 희소성을 저장장치까지 확장
MoE는 매 토큰에 전체 parameter를 쓰지 않는다. router가 선택한 일부 expert만 계산에 참여한다. slotstream은 이 특성을 이용해 자주 쓰는 expert를 통합 메모리에 남기고 나머지는 NVMe SSD에서 streaming한다. 메모리 부족을 swap에 맡겨 운영체제가 수동적으로 page를 밀어내게 하는 대신, 추론기가 어떤 weight가 필요한지 알고 직접 불러오는 구조다.
구현은 MLX와 Swift를 사용한 단일 binary이며 Python이 필요 없다. Ollama와 OpenAI의 chat API 일부를 제공해 기존 client를 바꾸지 않고 연결할 수 있다. streaming과 CORS, 일반 sampling 옵션은 지원하지만 tool calling, image, JSON Schema output, logprob은 아직 빠져 있다. 지원하지 않는 기능은 조용히 무시하지 않고 HTTP 400으로 돌려준다.
RAM보다 먼저 확인할 것은 SSD
설치 조건은 Apple Silicon, macOS 14 이상, 약 110GB의 여유 disk다. 48GB 이상에서는 33GB를 할당해도 속도가 더 오르지 않는다고 프로젝트는 설명한다. 8GB에서는 약 3 tok/s, 16GB는 약 4 tok/s, 24GB는 약 8 tok/s, 32GB는 약 9 tok/s로 제시됐지만 이 네 수치는 실제 장비 측정이 아니라 48GB 결과에서 만든 추정치다. 작은 Mac은 SSD도 느릴 수 있어 그대로 보장되는 성능은 아니다.
모델 weight는 24개 파일, 정확히 103.8GB다. 1Gbps data center 회선에서는 112MB/s로 16분이 걸렸고, 100Mbps 환경은 약 2시간 20분을 예상한다. 다운로드는 중단 뒤 재개할 수 있으며 각 파일을 binary에 포함된 SHA-256 hash로 검사한다. release artifact에는 CI provenance도 붙여 공급망 검증 경로를 마련했다.
댓글의 관심은 “32GB Mac도 로컬 AI에 쓸모가 있는가”로 모였다. 낮은 메모리 장비에서도 큰 모델을 실행할 가능성을 반기는 반응과 함께, 16GB 예상치가 열과 메모리 압박을 충분히 반영했는지 의문도 나왔다. 더 큰 모델보다 긴 context가 필요하다는 사용자도 있었다. SSD streaming은 모든 문제의 답이 아니라 모델 크기, context 길이, 발열, 저장장치 수명 사이에서 새 선택지를 추가한다.
slotstream의 성과는 104GB를 48GB로 압축했다는 뜻이 아니다. 계산할 순간에 필요한 weight만 제때 공급해 제한된 통합 메모리를 cache처럼 쓴 결과다. 로컬 추론의 경쟁축이 양자화율뿐 아니라 expert 배치와 I/O scheduling으로 넓어지고 있다.
관련 기사
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
Qwen 3.8 27B, 17GB에 담긴 실력보다 더 큰 문제는 ‘과한 생각’
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.