Fugu Ultra v2, Chartography 48.3점…Opus 5보다 21점 앞선 다중 모델 조율
단일 초대형 모델 대신 여러 공개·전문 모델을 조율하는 방식이 비용과 성능을 동시에 밀어 올렸다. Fugu Ultra v2는 Chartography 48.3점으로 Opus 5의 27.3점을 앞섰고, Fugu Max는 비교 대상보다 출력 가격을 40~60% 낮췄다. 두 제품은 즉시 API로 제공된다.
원문: Fugu Max and Fugu Ultra v2 extend the cost-performance frontier with model orchestration 원문 보기 →
단일 모델보다 21점 높은 시각·표 추론
여러 모델을 작업별로 골라 쓰는 조율 계층이 단일 최상위 모델의 성능과 비용 곡선을 넘어섰다는 결과가 나왔다. Sakana AI의 Fugu Ultra v2는 시각 자료와 구조화 데이터를 해석하는 Chartography에서 48.3점을 기록했다. Opus 5는 27.3점, Fable 5는 29.5점으로 각각 21점과 18.8점 낮았다. 실제 소프트웨어 공학 평가 DeepSWE에서는 74.3점을 기록하며 토큰 가격이 3~5배 높은 모델들을 앞섰다.
“Fugu Max delivers performance within striking distance of elite models at two to six times lower cost.” — Sakana AI 원문 게시물
원문은 2026년 9월 11일 2시 15분 UTC에 게시됐고, 확인 시점에 조회수 17만8천회, 좋아요 895건, 재게시 163건을 기록했다. Sakana AI 공식 계정은 일본 연구소의 모델, 진화 연산, 다중 에이전트 연구와 제품 배포를 함께 다룬다. 이번 게시물은 Fugu Max와 Fugu Ultra v2의 즉시 제공뿐 아니라 비용과 평가 점수를 구체적으로 제시했다.
Fugu Max는 10개 평가 중 7개에서 효율 경계 확장
Sakana AI의 출시 자료에 따르면 Fugu Max는 NVIDIA Nemotron 계열을 포함한 공개 가중치·전문 모델 풀에서 질의마다 가장 작은 적합 모델을 선택한다. 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러다. Sonnet 5, GPT-5.6 Terra, Kimi K3와 비교하면 출력 가격이 40~60% 낮다. Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench, 내부 코딩 평가 SWEFish 등 6개 평가에서 종합 최고점을 기록했고, 10개 중 7개에서 기존 비용 대비 성능 경계를 넓혔다.
Fugu Ultra v2는 비용보다 복잡한 다단계 작업의 최고 품질에 맞춘 변형이다. 8개 평가 가운데 GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon 등 5개에서 최고 또는 공동 최고였고 7개에서 상위 2위에 들었다. 중요한 제한도 있다. Fable 5, Fable 5.1, GPT-6 Astra는 조율 풀에 포함되지 않았지만, 일부 비교에 쓰인 SWEFish는 Sakana AI의 내부 사용 사례를 반영한 자체 평가다. 독립 재현 전에는 모든 수치를 동일한 무게로 볼 수 없다.
조율기의 선택 비용과 재현성이 다음 검증점
Fugu 기술 보고서는 조율기 자체도 언어모델이며, 질의를 해석해 작업별 에이전트 구조를 동적으로 만든다고 설명한다. 학습에는 대규모 미세조정, 진화 알고리즘, 강화학습이 함께 쓰였다. Max와 Ultra v2는 OpenAI 호환 API에서 즉시 제공되며 기존 Fugu 사용자는 모델 이름 한 줄만 바꾸면 된다.
다음에는 모델 선택과 병렬 호출에 드는 지연 시간, 실패한 하위 모델을 교체할 때 결과가 안정적으로 유지되는지, 공개 평가 조건에서 Chartography와 DeepSWE 점수가 재현되는지를 확인해야 한다. 가격 우위가 긴 작업의 총 호출 횟수까지 포함해 유지되는지도 중요하다. 조율 풀이 바뀔 때 같은 입력의 결과와 감사 기록을 보존하는 방식이 기업 도입의 실질적인 기준이 될 것이다.
관련 기사
GPT-6 Astra, Code Arena 웹개발 1위…Claude Fable 5.1에 35점 차
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
Sakana Fugu 베타 개시, SWEPro 54.2·GPQAD 95.1로 멀티에이전트 승부
Sakana AI가 여러 모델을 묶는 오케스트레이션을 연구 개념이 아니라 상용 API 상품으로 꺼냈다. 베타 수치만 보면 fugu-ultra는 SWEPro 54.2, GPQAD 95.1로 GPT 5.4 high와 Gemini 3.1 high를 각각 앞서는 구간을 만들었다.
4B 시각언어모델, 단일 A100 재현 경로로 GeoGuessr에서 GPT-5.4 mini·Haiku 추월
작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.