Fugu Ultra v2, Chartography 48.3점…Opus 5보다 21점 앞선 다중 모델 조율
단일 초대형 모델 대신 여러 공개·전문 모델을 조율하는 방식이 비용과 성능을 동시에 밀어 올렸다. Fugu Ultra v2는 Chartography 48.3점으로 Opus 5의 27.3점을 앞섰고, Fugu Max는 비교 대상보다 출력 가격을 40~60% 낮췄다. 두 제품은 즉시 API로 제공된다.
Insights
기사 7개
단일 초대형 모델 대신 여러 공개·전문 모델을 조율하는 방식이 비용과 성능을 동시에 밀어 올렸다. Fugu Ultra v2는 Chartography 48.3점으로 Opus 5의 27.3점을 앞섰고, Fugu Max는 비교 대상보다 출력 가격을 40~60% 낮췄다. 두 제품은 즉시 API로 제공된다.
큰 파일 읽기와 상용구 생성을 값싼 모델에 넘기고 어려운 판단만 Claude Code에 남기는 실험이 주목받았다. 평균 읽기 토큰을 약 90% 줄였지만 편집·디버깅·설계 판단까지 위임하면 정확도가 무너진다는 경계도 또렷하다.
모델 라우터가 왜 결제 회사에 중요한가. 931점을 받은 논의는 단순한 인수 소식보다 inference 사용량의 측정·청구·정산을 한 흐름으로 묶을 가능성을 파고들었다.
NVIDIA NeMo Switchyard는 한 에이전트 흐름 안에서 작업 난도에 따라 모델을 바꾸는 오픈소스 프록시다. OpenAI·Anthropic 형식을 번역하고 Claude Code, Codex, OpenClaw 3종을 연결한다.
Fireworks는 약 1,030개 agentic task에서 Kimi K3와 Fable 5를 라우팅했을 때 93% accuracy를 얻었다고 설명했다. HN의 관심은 특정 모델 승패보다, single model 선택이 점점 비효율적이라는 주장에 모였다.
기업 AI 도입의 병목이 모델 부족에서 운영 복잡도로 이동하고 있다. NVIDIA는 내부 Enterprise Inference Hub가 100개 넘는 모델 엔드포인트와 매주 수조 토큰 규모의 사용을 처리한다고 밝혔다.
모델 선택이 정적 리더보드에서 실행 중 라우팅 문제로 바뀌고 있다. OpenRouter는 Benchmarks API로 Artificial Analysis와 Design Arena 등 실시간 점수를 에이전트가 조회할 수 있게 했고, GLM-5.2가 코딩과 디자인 모두에서 최상위라고 적었다.