Fusion API, Fable 5급 연구 성능을 절반 가격으로 겨냥
OpenRouter가 여러 모델의 답을 병렬 합성하는 Fusion API를 공개하며 DRACO 100개 연구 과제에서 Fable 5에 1% 이내로 접근했다고 밝혔다. 핵심은 최고가 단일 모델이 아니라 예산 모델 패널과 판정 모델을 조합해 비용을 약 절반으로 낮춘 점이다.
원문: OpenRouter Fusion API claims Fable-level research at half price 원문 보기 →
예산 모델 패널이 연구형 LLM 가격을 다시 압박
복잡한 연구 질의에서 단일 대형 모델만 고르는 방식에 균열이 생기고 있다. OpenRouter는 2026년 6월 13일 X 스레드에서 Fusion API를 공개하며 “Fusion achieves Fable-level intelligence at half the price.”라고 적었다. 원문 트윗은 여기에서 확인할 수 있다.
스레드의 핵심 수치는 DRACO deep research benchmark다. OpenRouter는 Perplexity가 제시한 DRACO의 100개 고난도 연구 과제를 사용했고, 법률·의학·금융·제품 비교 등 10개 영역을 포함한다고 설명했다. 회사는 모델 패널이 개별 모델보다 꾸준히 낫고, 예산 모델 패널도 더 비싼 프런티어 모델에 근접하거나 넘어설 수 있다고 주장했다.
Fusion의 구조는 여러 모델을 동시에 호출한 뒤 judge model이 합의점, 모순, 누락, 고유한 통찰, blind spot을 뽑고, synthesizer가 최종 답을 만드는 방식이다. OpenRouter는 성능 향상의 약 75%가 합성 단계에서, 약 25%가 모델 다양성에서 나온다고 설명했다. 개발자는 단일 모델 슬러그처럼 openrouter/fusion을 부르거나 도구 배열에 {"type":"openrouter:fusion"}을 추가해 모델이 필요할 때 Fusion을 쓰게 할 수 있다.
OpenRouter는 DRACO 평가 중 모델이 온라인에 공개된 루브릭을 찾아내는 문제를 확인했고, 관련 도메인을 web search 설정에서 제외한 뒤 모든 수치를 다시 냈다고 덧붙였다. 다음 관전점은 외부 재현성이다. 100개 과제 결과와 비용 비교가 독립 검증에서도 유지된다면, 연구형 에이전트 시장의 경쟁축은 “가장 큰 모델”에서 “가장 잘 짜인 모델 패널”로 이동할 수 있다.
관련 기사
오픈 weight 모델 격차 3~6개월, OpenRouter가 꼽은 4개 축
OpenRouter는 6월 오픈 weight 모델 흐름을 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, NVIDIA Nemotron 3 Ultra 네 축으로 정리했다. 핵심 숫자는 SWE-bench Verified 79.0%, Intelligence Index 51, 1M context, 그리고 frontier API 대비 큰 가격 차이다.
LocalLLaMA 화제: Gemma 4 31B의 FoodTruck Bench 약진을 둘러싼 논쟁
LocalLLaMA 스레드가 Gemma 4 31B의 예상 밖 FoodTruck Bench 성과를 끌어올렸다. 토론은 곧 장기 계획 능력과 benchmark 신뢰성 문제로 이어졌다.
Opus 4.7 benchmark 급락에 Reddit이 본 것은 “모델이 약해졌나, 거절이 늘었나”였다
r/singularity의 Opus 4.7 thread가 뜨거웠던 이유는 41.0%라는 숫자보다 그 숫자의 원인을 둘러싼 해석 싸움이었다. NYT Connections extended benchmark에서 Opus 4.6의 94.7%와 대비되자, community는 capability regression과 refusal tuning을 나눠 보려 했다.