Local tool calling 현실 점검: r/LocalLLaMA가 본 문제는 model보다 harness였다
r/LocalLLaMA의 100점대 thread는 local tool calling 실패담을 model 탓으로 끝내지 않고, OpenWebUI·quant·runtime 조합 문제로 쪼개 봤다.
원문: Are you guys actually using local tool calling or is it a collective prank? 원문 보기 →
Community Spark
r/LocalLLaMA의 thread는 “local tool calling이 실제로 되는가”라는 직설적인 질문으로 100 points 안팎과 140개 넘는 comments를 모았다. 작성자는 Open WebUI, Docker Terminal, LM Studio 조합에서 Qwen3.5 27B/35B, Gemma4 26B, Qwen3.6 35B, GPT-OSS 20B를 써봤지만 file creation이 실패하거나 빈 파일을 성공처럼 설명하고, executing loop에 걸린다고 적었다.
댓글의 첫 반응
상위 댓글들은 “local model이 전부 안 된다”보다 harness 문제를 먼저 의심했다. 여러 사용자가 OpenWebUI를 weak link로 지목했고, OpenCode에서는 같은 류의 tool calling이 훨씬 낫다고 말했다. Cline in VSCode나 llama.cpp, LM Studio runtime을 조합해 안정적으로 쓴다는 답도 있었다. 즉 model family보다 UI wrapper와 tool-call protocol handling이 결과를 크게 바꾼다는 쪽으로 의견이 모였다.
기술적으로 갈린 변수
커뮤니티가 반복해서 짚은 변수는 quantization, native tool calling 설정, reasoning field 처리였다. 한 댓글은 Q5 이하의 aggressive quant가 작은 model에서 문제를 만들 수 있다고 했고, 다른 댓글은 OpenWebUI가 reasoning을 API field가 아니라 think tags처럼 돌려주는 경우를 지적했다. OpenWebUI의 prompted tool calling 기본값과 native tool calling 설정 차이도 중요한 체크리스트로 올라왔다.
Takeaway
이 thread의 값은 benchmark보다 운영 감각에 있다. local tool calling은 “된다/안 된다”가 아니라 model, quant, runtime, harness, tool schema, async shell behavior가 함께 맞아야 한다. r/LocalLLaMA의 결론은 냉정하다. Qwen 계열 같은 model이 좋아졌더라도, wrapper가 reasoning과 tool calls를 정확히 전달하지 못하면 사용자는 hallucinated file write와 stuck execution을 경험한다. local agents를 평가할 때는 model name보다 full stack을 기록해야 한다.
Source: r/LocalLLaMA discussion.
관련 기사
Qwen3+ streaming parser, LocalLLaMA가 반긴 작은 vLLM 수정
Qwen3.6-27B를 vLLM에서 agent loop로 돌리던 사용자들이 멈춤과 streaming tool call 오류에 예민하게 반응했다. nightly parser 수정은 작지만, 로컬 에이전트 운용에서는 체감이 큰 문제를 겨냥한다.
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
Qwen 3.8 27B, 17GB에 담긴 실력보다 더 큰 문제는 ‘과한 생각’
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.