MacBook Air M5 32GB에서 37개 LLM을 비교한 LocalLLaMA 벤치마크
LocalLLaMA에 공유된 Mac LLM Bench 결과는 32GB Apple Silicon 환경에서 MoE 모델이 dense 32B 계열보다 더 나은 latency-to-capability 균형을 보일 수 있음을 시사한다. 중요한 점은 숫자 하나보다 재현 가능한 benchmark workflow 자체다.
원문: I benchmarked 37 LLMs on MacBook Air M5 32GB — full results + open-source tool to benchmark your own Mac 원문 보기 →
최근 LocalLLaMA 글에서는 Mac LLM Bench라는 오픈 저장소와 함께 Apple Silicon에서의 local LLM 성능 비교 결과가 공유됐다. 작성자는 32 GB MacBook Air M5에서 llama-bench와 Q4_K_M quantization을 사용해 10개 family, 37개 model을 측정했고, 숫자뿐 아니라 재현 가능한 스크립트까지 공개했다.
가장 흥미로운 대목은 단순히 누가 1등이냐가 아니다. 게시된 결과에 따르면 Qwen 3.5 35B-A3B MoE는 tg128 기준 31.3 tokens/sec를 기록하면서 약 20.7 GB RAM을 사용했다. 반면 dense 32B급 모델들은 대체로 18.6~18.7 GB 메모리에서 약 2.5 tokens/sec 근처에 모였다. 물론 더 작은 모델은 훨씬 빠르다. 예를 들어 Qwen 3 0.6B는 91.9 tok/s, Llama 3.2 1B는 59.4 tok/s를 기록했다. 하지만 실제로 흥미로운 비교는 중대형 모델에서 interactivity와 capability를 어떻게 맞추느냐다.
저장소는 anecdotal screenshot보다 reproducibility에 초점을 둔다. GGUF 경로는 llama.cpp, MLX 경로는 mlx_lm.benchmark를 사용하며, pp128, pp256, pp512, tg128, tg256 같은 fixed-token metric을 같은 형식으로 저장한다. 결과는 chip generation과 hardware configuration별로 정리되며, README 기준 M5 섹션에는 GGUF와 MLX를 합쳐 41 benchmarks가 기록돼 있다.
개발자가 읽어야 할 포인트
이 글의 실질적인 가치는 32 GB Apple laptop의 한계를 꽤 선명하게 보여준다는 점이다. dense 32B 모델에는 뚜렷한 wall이 있고, MoE 설계는 경우에 따라 더 나은 latency-to-capability tradeoff를 줄 수 있다는 것이다. 물론 이 수치가 보편적 진실은 아니다. runtime 선택, quantization, thermals, prompt 형태가 모두 영향을 준다. 그럼에도 community-maintained benchmark baseline으로서는 충분히 유용하다.
- 이번 결과의 기준 장비는 MacBook Air M5 with 32 GB RAM이다.
- 주요 도구는
llama-bench이며, 별도로 MLX benchmark도 지원한다. - 프로젝트 목표는 M1부터 M5까지 이어지는 cross-generation benchmark database를 만드는 것이다.
로컬 LLM 사용자에게 중요한 것은 한 장의 leaderboard 이미지가 아니다. 다른 개발자도 자신의 장비로 확장할 수 있는 repeatable benchmark workflow가 등장했다는 점이 더 큰 의미를 가진다.
관련 기사
104GB Qwen을 48GB Mac에서 12 tok/s로, slotstream의 SSD 승부
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.
Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파
Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.
RTX 5090부터 AMD AI395까지, LocalLLaMA 벤치마크가 보여준 현실적인 선택지
r/LocalLLaMA의 llama.cpp 비교 글은 55 upvotes와 81 comments를 기록했다. RTX 5090, DGX Spark, AMD AI395, single과 dual R9700를 같은 parameter로 비교해 local inference hardware의 현실적인 trade-off를 보여줬다.