Qwen3.8-Max, 2.4T 매개변수와 공개 가중치로 코딩 모델 판도 흔들기
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
원문: Qwen3.8-Max puts 2.4T parameters and open weights on the coding map 원문 보기 →
2.4T 모델이 공개 가중치 경쟁으로 이동
초대형 코딩 모델 경쟁이 성능표에서 배포 자유도와 가격표로 옮겨가고 있다. Qwen은 2026년 8월 3일 X에서 “open weights of Qwen3.8-Max will be released”라고 적고, Qwen3.8-Max와 Qwen3.8-27B의 공개 가중치를 다음 주 내놓겠다고 밝혔다. 이 트윗은 생성형 AI 제품 홍보보다 더 큰 의미가 있다. 2.4T 매개변수 MoE 모델을 API로 먼저 열고, 곧 가중치까지 공개하겠다는 조합이기 때문이다.
QwenCloud 모델 페이지는 Qwen3.8-Max를 코딩과 전문 업무용 2.4T MoE 플래그십으로 설명한다. 최대 입력은 991K 토큰, 컨텍스트는 1M이며, 출력 한도는 131K 토큰이다. 가격은 입력 $2/M 토큰, 출력 $6/M 토큰, 암묵 캐시 입력 $0.25/M 토큰으로 표시된다. 내장 도구도 code interpreter, web search, web extractor, 이미지 검색 계열까지 포함된다.
트윗에서 가장 눈에 띄는 주장은 장기 자율 작업이다. Qwen은 빈 폴더에서 제품 수준 결과물까지 10일 이상 스스로 진화하는 개발, 500회 이상 이어진 칩 설계 최적화, 365일 전자상거래 전략 같은 장기 계획 사례를 언급했다. 연결된 GitHub 저장소 qwen-code-dev-bot/oh-my-cli는 Apache-2.0 라이선스의 작은 코드 에이전트 CLI로 공개돼 있으며, 파일·셸 도구를 갖춘 Node.js 22/TypeScript 프로젝트다.
검증해야 할 부분도 분명하다. 공개 가중치가 실제로 어떤 라이선스와 사용 제한으로 나오는지, 1M 컨텍스트가 장기 코딩 작업에서 비용과 지연을 어떻게 바꾸는지, 그리고 Qwen이 제시한 장기 자율 작업 사례가 외부 벤치마크로 재현되는지가 관건이다. 원문 트윗은 X에서 볼 수 있다.
관련 기사
Qwen3.6-35B-A3B, HN이 주목한 건 3B active MoE의 코딩 성능이었다
HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.
LocalLLaMA가 주목한 OmniCoder-9B의 소형 coding agent 실험
LocalLLaMA의 release post는 OmniCoder-9B를 425,000개 이상 agentic trajectory로 학습한 Qwen3.5-9B 기반 coding agent로 소개했고, 댓글은 read-before-write 같은 실제 작업 습관에 주목했다.
27B dense로 여기까지, Qwen3.6에 HN이 꽂힌 이유
HN은 Qwen3.6-27B를 벤치마크 승리보다 현실적으로 돌릴 수 있는 오픈 코딩 모델로 읽었다. 댓글도 점수표보다 메모리 요구량, self-hosting 가능성, dense 구조의 운영 단순성에 몰렸다.