본문으로 건너뛰기

Qwen3.6 Local Inference Watch: MoE, GGUF, 튜닝

16 편 2026년 4월 29일 업데이트 #qwen#local-llm#open-weights#benchmarks

현재 상황

Qwen3.6-35B-A3B 공개부터 HN coding-performance 논쟁, pelican benchmark, GGUF quant 선택, --n-cpu-moe 튜닝, M5 Max 64k context 실측까지 local inference 운영 흐름을 순서대로 묶습니다.

최근 변화

  • Qwen 3.6 27B 양자화 비교, LocalLLaMA가 꽂힌 건 Q4_K_M… 그런데 숫자 논쟁
  • RTX 3090에서 거의 2배, LocalLLaMA가 Luce DFlash에 몰린 이유
  • Qwen3.6 27B, RTX 5090 한 장에서 100 tps… LocalLLaMA가 바로 물은 건 품질이었다

핵심 쟁점

낙관론: Qwen3.6 Local Inference Watch: MoE, GGUF, 튜닝이(가) 실질적이고 누적되는 레버리지를 만들어냅니다.
신중론: Qwen3.6 Local Inference Watch: MoE, GGUF, 튜닝의 신뢰성·비용·통제 문제는 아직 해결되지 않았습니다.

주목할 신호

  • ‘qwen’ 관련 모멘텀과 새로운 보도
  • ‘local-llm’ 관련 모멘텀과 새로운 보도
  • ‘open-weights’ 관련 모멘텀과 새로운 보도

타임라인

최신
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
LLM 레딧

LocalLLaMA의 Qwen3.6 열기: 성능보다 설정이 먼저였다

LocalLLaMA에서 반응이 컸던 포인트는 "새 모델이 세다"보다 "제대로 켜야 보인다"는 실전 팁이었다. 작성자는 M5 Max 128GB 환경에서 Qwen3.6을 8bit로 돌리며 Opus와 Codex에 맡기던 일부 작업을 처리했다고 했고, 핵심 설정으로 preserve_thinking을 짚었다.

1분 소요 38 조회
최근 전개
최근 전개
최근 전개
최근 전개
최근 전개
LLM 해커뉴스

Qwen3.6-35B-A3B, HN이 주목한 건 3B active MoE의 코딩 성능이었다

HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.

1분 소요 51 조회
공유: 긴글