본문으로 건너뛰기

Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기

Original: Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency View original →

Read in other languages: English日本語
LLM Aug 26, 2026 By Insights AI (HN) 1 min read 1 views Source

Qwen4 아키텍처의 초기 공개

알리바바 Qwen 팀이 2026년 8월 26일 Qwen3.8-Flash-Next를 오픈소스 공개했다. Qwen4의 아키텍처를 커뮤니티가 먼저 검토할 수 있도록 선공개하는 것으로, 과거 Qwen3-Next가 Qwen3.5 시리즈의 선행 지표 역할을 했던 것과 동일한 방식이다.

125B 파라미터의 주요 모델에 51B N-gram 임베딩을 추가해 총 176B 규모이지만, 토큰당 활성화되는 파라미터는 6B에 불과하다. Qwen3.7-Plus 대비 훈련 비용이 약 9분의 1이면서도 코딩과 사무 자동화 작업에서 더 높은 성능을 달성했다.

네 가지 핵심 아키텍처 혁신

GDN + QSA 하이브리드 어텐션: 4개 레이어 중 3개는 Gated DeltaNet(GDN)으로 과거 정보를 고정 크기 상태로 압축하고, 나머지 1개 레이어는 Qwen Sparse Attention(QSA)으로 전체 문맥에서 정밀하게 검색한다. 1M 토큰에서 90% 프리픽스 캐시 히트율 기준 Prefill 처리량이 Qwen3.7-Plus 대비 8.6배 향상됐다.

Gated Residual: 단일 잔차 스트림을 4개 병렬 브랜치로 확장하고 동적 게이트로 읽기·쓰기를 제어한다. 레이어 간 정보 흐름을 강화하면서 훈련 안정성을 높이고 잔차 상태를 FP8으로 저장해 메모리 오버헤드를 줄였다.

N-gram Embedding: 51B 파라미터 임베딩 테이블을 현재 토큰과 앞선 토큰들의 로컬 문맥으로 참조한다. 호스트 메모리에 오프로드해 GPU 메모리를 점유하지 않으면서 토큰당 추가 연산이 거의 없다.

Muon 옵티마이저: AdamW 대신 Muon을 사용해 더 큰 학습률과 배치 크기로 수렴 효율을 높였다. 배치 크기 웜업이 불필요함을 확인해 옵티마이저 스텝을 18.8% 절약했다.

성능 결과

DeepSWE 1.1에서 58.7점, SWE-bench Pro에서 62.5점(비교 모델 최고), SWE-bench Multilingual에서 81.0점을 기록했다. 에이전트 작업에서는 Toolathlon Verified 73.5점, CoWorkBench 73.9점(1위), JobBench 55.7점(1위)을 달성했다. LiveCodeBench v6에서 91.9점, GPQA Diamond에서 91.7점의 추론 성능을 보였다.

이용 방법

모델 가중치는 HuggingFace와 ModelScope에서 공개 제공된다. QwenCloud에서 qwen3.8-flash로 서비스되며, 입력 100만 토큰당 $0.16, 출력 100만 토큰당 $0.47이다. Claude Code, Codex, Qwen Code 등과의 통합도 지원한다.

Share: Long

Related Articles