LocalLLaMA 비교: Qwen3.5 397B 구동에서 Dual DGX Sparks와 512GB Mac Studio 맞대결
LocalLLaMA의 한 상세 벤치마크 포스트가 Qwen3.5 397B A17B를 기준으로 $10K Dual DGX Sparks와 $10K Mac Studio M3 Ultra 512GB를 비교했다. Mac은 30~40 tok/s generation과 쉬운 setup, Dual Sparks는 더 빠른 prefill과 embedding 처리 성능을 보여줬지만 운영 난이도는 훨씬 높았다.
원문: Dual DGX Sparks vs Mac Studio M3 Ultra 512GB: Running Qwen3.5 397B locally on both. Here's what I found. 원문 보기 →
비교가 나온 배경
Reddit r/LocalLLaMA에서 올라온 한 장문의 벤치마크 포스트가, 대형 open model을 local로 운영하려는 사용자들에게 매우 구체적인 비교 데이터를 제공했다. 크롤링 시점 기준 이 글은 402점, 229개 댓글을 기록했다. 작성자는 개인 Slack assistant를 돌리기 위해 Claude API에 월 $2K 정도를 쓰다가, 장기적으로 local inference가 더 낫다고 판단해 $10K짜리 Mac Studio M3 Ultra 512GB와 비슷한 비용의 Dual DGX Spark 구성을 모두 구매했다고 설명한다.
비교 대상 모델은 Qwen3.5 397B A17B다. 작성자에 따르면 Mac Studio에서는 MLX 6 bit quantization으로 323GB 모델을 512GB unified memory에 적재했고, generation 속도는 30 to 40 tok/s가 나왔다. Mac의 핵심 강점은 약 800 GB/s 수준의 memory bandwidth로, 거대한 모델에서도 token generation이 부드럽다는 점이다. 설치도 상대적으로 단순했지만, prefill은 큰 system prompt와 tool definition에서 30+초가 걸렸고, MLX VLM이 tool call 처리와 thinking token 제거를 기본 제공하지 않아 별도 async proxy를 직접 작성해야 했다고 한다.
Dual DGX Sparks가 보여준 것
Dual Sparks 쪽은 INT4 AutoRound로 node당 98GB 모델을 두 개의 128GB node에 나눠 적재하고, vLLM TP=2로 구동했다. generation은 27 to 28 tok/s로 Mac보다 약간 낮았지만, prefill은 더 빨랐고 batch embedding 성능은 훨씬 좋았다고 적었다. CUDA tensor core, vLLM kernel, tensor parallelism 덕분에 inference 외 workload까지 병행하기에는 Dual Sparks가 더 유리하다는 평가다.
문제는 setup 난이도였다. 작성자는 QSFP cable 하나만 정상 동작했고, Node2 IP가 reboot 후 사라졌으며, GPU memory ceiling은 0.88 근처를 직접 binary search 해야 했다고 적었다. page cache를 두 node 모두에서 비워야 mystery OOM을 피할 수 있었고, 일부 유닛은 20분 안에 thermal throttling이 걸렸다고도 한다. 즉, 성능 자체보다 운영 안정화에 드는 시간이 큰 비용이라는 결론이다.
실전적 결론
이 포스트의 흥미로운 지점은 “누가 더 빠른가”보다 “누가 어떤 역할에 맞는가”를 분리했다는 데 있다. 작성자는 최종적으로 Mac Studio는 inference 전용, Dual Sparks는 RAG, embedding, reranking 전용으로 두고 Tailscale로 연결하는 구조를 택했다. 계산상 $20K hardware cost는 월 $2K API spend 기준 약 10개월이면 손익분기점에 도달한다는 설명도 덧붙였다.
LocalLLaMA 커뮤니티 입장에서 이 비교는, 거대 모델 local 운영이 더 이상 취미 프로젝트 수준에만 머물지 않는다는 점을 보여준다. 다만 쉬운 도입과 매끄러운 generation은 Mac Studio가, 복합 workload와 CUDA ecosystem 활용은 Dual Sparks가 더 낫다는 식으로 선택 기준이 뚜렷하게 갈린다.
출처: r/LocalLLaMA 원문
관련 기사
Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파
Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.
GPT-6 Astra, Code Arena 웹개발 1위…Claude Fable 5.1에 35점 차
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
Gemini 3.7 Flash, 실무 분석 60.0%로 Claude Opus 5보다 6.2%p 앞서
실제 스프레드시트·문서를 다루는 독립 평가에서 Gemini 3.7 Flash가 60.0%를 기록해 Claude Opus 5의 53.8%를 6.2%포인트 앞섰다. 빠른 Flash 계열이 최고급 모델보다 반복 정확도에서 우위를 보이면서, 분석 에이전트의 비용·속도·신뢰성 조합을 다시 따져볼 근거가 생겼다.