Qwen3.6-35B-A3B, HN이 주목한 건 3B active MoE의 코딩 성능이었다
HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.
원문: Qwen3.6-35B-A3B: Agentic Coding Power, Now Open to All 원문 보기 →
HN discussion에서 Qwen3.6-35B-A3B는 단순한 model release보다 더 실용적인 질문으로 읽혔다. 숫자상 headline은 35B total parameter지만, 커뮤니티가 붙잡은 부분은 sparse MoE 구조다. Qwen은 이 모델을 35B total, 약 3B active parameter로 설명했고, Hugging Face와 ModelScope에 open weights를 올렸으며, Qwen Studio에서 사용 가능하고 API에서는 Qwen3.6-Flash로 제공될 예정이라고 적었다.
이 구조가 중요한 이유는 coding agent를 실제 workflow 안에 넣으려는 팀들이 frontier model 수준의 serving 비용을 계속 감당하기 어렵기 때문이다. Qwen의 자체 표에서 Qwen3.6-35B-A3B는 SWE-bench Verified 73.4, Terminal-Bench 2.0 51.5, MCPMark 37.0, QwenWebBench 1397 Elo를 기록했다. 각 benchmark harness와 비교군은 따져봐야 하지만, HN은 이 수치를 작은 active-parameter MoE가 software 작업에서 진지하게 검토될 수 있다는 신호로 받아들였다.
댓글 흐름은 open-weight 모델이 실제로 채택되는 방식을 잘 보여줬다. 한 사용자는 Unsloth의 GGUF conversion을 바로 공유했고, 다른 사용자들은 36GB Mac에서 context를 얼마나 실을 수 있는지, 9B나 27B variant가 더 필요하지 않은지, 그리고 open model끼리만 비교한 표가 proprietary model을 쓰는 개발자에게 충분한 기준이 되는지 물었다.
핵심은 Qwen이 또 하나의 score table을 냈다는 사실이 아니다. HN은 이 모델을 infrastructure처럼 대했다. quantization이 되는가, local machine에서 돌아가는가, memory budget 안에 들어오는가, tool use와 긴 context가 필요한 coding-agent task를 버티는가. 지금 open model이 통과해야 하는 테스트는 바로 그쪽에 가깝다.
관련 기사
Qwen3.8-Max, 2.4T 매개변수와 공개 가중치로 코딩 모델 판도 흔들기
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.
r/LocalLLaMA 화제: Hugging Face의 Qwen3.5-35B-A3B 모델 카드 공개
LocalLLaMA 커뮤니티에서 Qwen3.5-35B-A3B 모델 카드가 빠르게 확산됐다. MoE 구조, 긴 context, 다양한 serving 프레임워크 호환성이 핵심 포인트로 언급된다.