Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
Original: Qwen 3.8 27B View original →
Qwen3.8-27B는 27B 규모의 dense 모델을 로컬에서 돌리면서 코딩, 긴 작업, 이미지·영상 이해까지 한 묶음으로 처리하려는 선택지다. 공개 직후의 관심도 단순한 벤치마크 숫자보다 ‘내 장비에서 실제 일을 끝낼 수 있는가’에 모였다. 한 사용자는 개인 평가 문제를 풀어낸 두 번째 로컬 모델이라고 전했고, 다른 사용자는 웹 앱과 Rust·Tauri 재작성을 거의 한 번에 마쳤다고 설명했다. 다만 좋은 결과 뒤에는 긴 추론 시간과 큰 메모리 부담이 따라붙었다.
27B 안에 넣은 긴 작업용 설계
공식 모델 카드에 따르면 Qwen3.8-27B는 64개 층, 27B 파라미터를 가진 vision-language 모델이다. 기본 context length는 262,144 tokens이며 최대 1,000,000 tokens까지 확장할 수 있다. FP8 배포판은 128 block 단위의 fine-grained quantization을 사용하고, 원본과 거의 같은 성능을 목표로 한다. Apache 2.0 라이선스와 Transformers, vLLM, SGLang, TokenSpeed 지원도 로컬 배포 수요에 잘 맞는다.
Qwen이 제시한 자체 결과는 이전 세대보다 큰 폭의 개선을 가리킨다. Terminal Bench 2.1은 73.0, SWE-bench Pro는 61.7, DeepSWE 1.1은 42.2로 기재됐다. 특히 DeepSWE에서 Qwen3.6-27B의 13.3보다 크게 올랐다. 다만 이 수치는 제작사가 공개한 평가이며, 실제 처리량과 품질은 quantization 방식, harness, GPU, prompt에 따라 달라진다.
성능의 반대편에 있는 추론 비용
thinking mode는 기본으로 켜져 있고 reasoning_effort를 xhigh, medium, low로 조정할 수 있다. 공식 문서는 낮은 단계가 매 응답은 빨라도 실패와 재시도를 늘려 전체 작업 시간을 길게 만들 수 있다고 경고한다. 반대로 초기 사용자 경험에서는 기본 xhigh가 지나치게 오래 고민하거나 코드가 불필요하게 복잡해지는 사례도 나왔다. 한 MacBook Pro 테스트는 17GB GGUF로 SVG를 만드는 데 21분, reasoning 22,276 tokens와 output 3,223 tokens가 들었다고 기록했다.
커뮤니티 논점은 그래서 ‘27B가 대형 폐쇄형 모델을 이겼는가’보다 더 실용적이다. 어떤 작업은 low 설정에서 빠르고 단단하게 끝났고, 어떤 설정은 긴 생각의 반복에 빠졌다. Qwen3.8-27B는 작은 로컬 모델의 능력 상한을 높였지만, 그 능력을 꺼내는 비용까지 작아졌다는 뜻은 아니다. 도입을 검토한다면 공개 벤치마크 하나보다 자신의 context 길이, VRAM, 허용 지연 시간으로 세 가지 reasoning 설정을 직접 비교하는 편이 낫다.
Qwen3.8-27B-FP8 모델 카드에서 사양과 실행 방법을 확인할 수 있다.
Related Articles
r/LocalLLaMA의 한 글은 Qwen3.5 27B가 quality와 deployability 사이에서 드문 균형점을 만든다고 주장한다. 게시물은 RTX A6000 48GB, llama.cpp with CUDA, 32K context에서 약 19.7 tokens/sec를 보고했고, 댓글에서는 dense 27B와 35B-A3B MoE의 VRAM economics가 활발히 비교됐다.
Qwen3.5 출시 몇 주 뒤, r/LocalLLaMA는 general chat, coding, tool use에 맞는 sampler와 reasoning budget을 분리해 쓰는 방향으로 경험칙을 모으고 있다.
r/LocalLLaMA에서 CPU 메모리로 offload한 가중치를 미리 가져와 prompt 처리 속도를 끌어올리려는 llama.cpp 실험이 주목을 받았다. 긴 context에서 hybrid CPU/GPU 추론의 병목을 줄이려는 시도다.