본문으로 건너뛰기

Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’

Original: Qwen 3.8 27B View original →

Read in other languages: English日本語
LLM Aug 16, 2026 By Insights AI (HN) 1 min read 1 views Source

Qwen3.8-27B는 27B 규모의 dense 모델을 로컬에서 돌리면서 코딩, 긴 작업, 이미지·영상 이해까지 한 묶음으로 처리하려는 선택지다. 공개 직후의 관심도 단순한 벤치마크 숫자보다 ‘내 장비에서 실제 일을 끝낼 수 있는가’에 모였다. 한 사용자는 개인 평가 문제를 풀어낸 두 번째 로컬 모델이라고 전했고, 다른 사용자는 웹 앱과 Rust·Tauri 재작성을 거의 한 번에 마쳤다고 설명했다. 다만 좋은 결과 뒤에는 긴 추론 시간과 큰 메모리 부담이 따라붙었다.

27B 안에 넣은 긴 작업용 설계

공식 모델 카드에 따르면 Qwen3.8-27B는 64개 층, 27B 파라미터를 가진 vision-language 모델이다. 기본 context length는 262,144 tokens이며 최대 1,000,000 tokens까지 확장할 수 있다. FP8 배포판은 128 block 단위의 fine-grained quantization을 사용하고, 원본과 거의 같은 성능을 목표로 한다. Apache 2.0 라이선스와 Transformers, vLLM, SGLang, TokenSpeed 지원도 로컬 배포 수요에 잘 맞는다.

Qwen이 제시한 자체 결과는 이전 세대보다 큰 폭의 개선을 가리킨다. Terminal Bench 2.1은 73.0, SWE-bench Pro는 61.7, DeepSWE 1.1은 42.2로 기재됐다. 특히 DeepSWE에서 Qwen3.6-27B의 13.3보다 크게 올랐다. 다만 이 수치는 제작사가 공개한 평가이며, 실제 처리량과 품질은 quantization 방식, harness, GPU, prompt에 따라 달라진다.

성능의 반대편에 있는 추론 비용

thinking mode는 기본으로 켜져 있고 reasoning_effortxhigh, medium, low로 조정할 수 있다. 공식 문서는 낮은 단계가 매 응답은 빨라도 실패와 재시도를 늘려 전체 작업 시간을 길게 만들 수 있다고 경고한다. 반대로 초기 사용자 경험에서는 기본 xhigh가 지나치게 오래 고민하거나 코드가 불필요하게 복잡해지는 사례도 나왔다. 한 MacBook Pro 테스트는 17GB GGUF로 SVG를 만드는 데 21분, reasoning 22,276 tokens와 output 3,223 tokens가 들었다고 기록했다.

커뮤니티 논점은 그래서 ‘27B가 대형 폐쇄형 모델을 이겼는가’보다 더 실용적이다. 어떤 작업은 low 설정에서 빠르고 단단하게 끝났고, 어떤 설정은 긴 생각의 반복에 빠졌다. Qwen3.8-27B는 작은 로컬 모델의 능력 상한을 높였지만, 그 능력을 꺼내는 비용까지 작아졌다는 뜻은 아니다. 도입을 검토한다면 공개 벤치마크 하나보다 자신의 context 길이, VRAM, 허용 지연 시간으로 세 가지 reasoning 설정을 직접 비교하는 편이 낫다.

Qwen3.8-27B-FP8 모델 카드에서 사양과 실행 방법을 확인할 수 있다.

Share: Long

Related Articles