RTX 3090 하나로 SimpleQA 95.7%: Qwen3.6-27B + 에이전틱 검색의 위력
로컬 LLM 연구자가 단일 RTX 3090에서 Qwen3.6-27B와 에이전틱 검색을 결합해 SimpleQA 벤치마크 95.7%를 달성했다.
원문: We are finally there: Qwen3.6-27B + agentic search; 95.7% SimpleQA on a single 3090, fully local 원문 보기 →
95.7%의 의미
r/LocalLLaMA에 297점으로 공유된 이 결과는 RTX 3090(24GB) 단일 GPU로 완전 로컬 환경에서 SimpleQA 95.7%를 달성한 것이다. SimpleQA는 사실 정확성을 측정하는 OpenAI 벤치마크로 95% 이상은 클라우드 서비스 수준이다.
설정
- GPU: RTX 3090 (24GB)
- 모델: Qwen3.6:27b (Ollama)
- 전략: LangGraph 에이전트 + 병렬 서브토픽 분해
왜 중요한가
에이전틱 검색과 로컬 LLM의 결합으로 소비자용 GPU 하나로 클라우드급 정확도를 달성했다. 외부 API 없이도 고품질 Q&A 시스템을 구축할 수 있는 시대가 열리고 있다.
관련 기사
3090 한 장에서 218K 문맥, LocalLLaMA가 속도보다 안정성에 반응한 이유
LocalLLaMA가 본 포인트는 최고 속도가 아니었다. RTX 3090 한 장으로 218K 문맥을 밀어 올리고 긴 tool output에서도 덜 무너지는 구성이 더 중요했다.
Qwen 3.8 27B, 17GB에 담긴 실력보다 더 큰 문제는 ‘과한 생각’
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.