104GB Qwen을 48GB Mac에서 12 tok/s로, slotstream의 SSD 승부
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.
태그
#qwen 태그가 달린 기사
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.
Qwen3.8-Max의 9월 2일 체크포인트가 프런트엔드 CodeArena에서 1,691점으로 선두에 올랐다. 기반 규모를 바꾼 신모델이 아니라 코딩과 장기 에이전트 작업을 겨냥한 후훈련 갱신이며, 100만 토큰 문맥과 API 호환성을 그대로 유지한다.
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
공개 모델 생태계의 실제 사용은 초대형 모델보다 작은 모델과 Qwen 계열에 집중됐다. Qwen 파생 저장소는 151,448개이며 월간 GGUF 다운로드는 3,960만건으로 Llama의 5배를 넘는다. 10억 매개변수 미만 모델이 누적 다운로드의 83%를 차지해 관심과 실사용의 격차를 드러냈다.
관심은 “큰 모델을 줄이는 법”보다 MoE expert를 저장장치에서 스트리밍해 소비자 기기에서 버티게 만드는 구조에 모였다.
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
NVIDIA Research의 Spatial-IQ는 3D 물체 세기를 9개 하위 과제로 쪼개 모델의 실패 지점을 분리한다. 인간 정확도 82.1%에 비해 최고 범용 멀티모달 모델은 17.7%였고, Qwen2.5-VL-32B는 훈련 후 2.9%에서 62.6%로 올랐다.
privacy와 비용을 잡으려는 개발자들이 Qwen 3.6 27B의 “충분히 쓸 만한” 지점을 파고들었다.
Alex Ellis의 글이 주목받은 이유는 local LLM을 benchmark 순위가 아니라 실제 사업과 agent 작업의 비용·통제 문제로 다뤘기 때문이다.
Qwen이 로봇용 foundation model을 navigation, manipulation, world modeling 세 갈래로 묶었다. Qwen-RobotNav, Qwen-RobotManip, Qwen-RobotWorld는 physical AI의 병목을 “인식”에서 “행동”으로 옮겨 놓는 release다.