r/LocalLLaMA가 주목한 llama.cpp reasoning budget 제어
새로운 llama.cpp 변경은 <code>--reasoning-budget</code>를 template stub이 아니라 sampler 차원의 실제 제어로 바꾼다. LocalLLaMA thread는 긴 think loop를 줄이는 것과 answer quality를 지키는 것 사이의 tradeoff, 특히 local Qwen 3.5 환경에서의 의미를 집중적으로 논의했다.
원문: Llama.cpp now with a true reasoning budget! 원문 보기 →
왜 LocalLLaMA가 이 변경에 반응했나
local reasoning model은 강력하지만, 단순한 질문에도 길게 생각하면서 latency와 token을 낭비하는 일이 잦다. 그래서 r/LocalLLaMA thread가 이 llama.cpp commit에 바로 반응했다. 이번 변경은 real reasoning-budget sampler를 추가하고, parser와 chat handling을 확장해 reasoning block 내부의 token 수를 세다가 budget이 끝나면 종료를 유도할 수 있게 만든다. 기존의 --reasoning-budget가 사실상 template 쪽 disable stub에 가까웠다면, 이제는 sampler layer에서 직접 제어하는 방향으로 바뀐 셈이다.
이 post가 좋은 이유는 단순 기능 소개가 아니라 실패 데이터까지 함께 보여준다는 점이다. 작성자에 따르면 hard cutoff는 Qwen3 9B HumanEval score를 크게 망가뜨렸다. full reasoning은 94%, non-reasoning은 88%였는데, 강제 budget은 78%까지 떨어졌다. 이를 완화하려고 추가된 것이 --reasoning-budget-message다. thinking이 끝나기 직전에 짧은 handoff message를 넣어 모델이 자연스럽게 answer phase로 넘어가게 하는 방식이며, budget 1000과 transition message를 썼을 때 보고된 HumanEval score는 89%까지 회복됐다.
thread가 드러낸 실전 쟁점
comments는 금방 control problem으로 옮겨갔다. 어떤 사람은 end-of-think token의 bias를 점진적으로 올려 hard stop보다 자연스러운 종료를 만들자고 했고, 다른 사람은 CLI와 HTTP field naming 차이를 지적했다. 또 여러 사용자는 로컬 환경에서 reasoning model이 사소한 prompt에도 80초 넘게 overthink하는 문제가 실제 사용성을 크게 해친다고 말했다. 결국 필요한 것은 on/off toggle 하나가 아니라, latency, power, answer quality를 조절하는 실전용 knob라는 뜻이다.
그래서 이 commit의 의미는 parser tweak 이상이다. local inference stack이 hosted reasoning API처럼 운영 제어면을 갖추기 시작했다는 신호다. MacBook, desktop, 소형 server에서 llama.cpp를 돌리는 사람들에게 reasoning budget은 benchmark용 옵션이 아니라, 체감 사용성을 바꾸는 기능에 가깝다.
관련 기사
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
Qwen 3.8 27B, 17GB에 담긴 실력보다 더 큰 문제는 ‘과한 생각’
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
4개월 만에 네 번째 Flash — Gemini 3.8의 추론·코딩 도약
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.