Perplexity、Qwen SFT+RLでGPT factualityの検索費用曲線を上回る主張
Original: Perplexity said SFT and RL post-training let Qwen models match or beat GPT factuality at lower cost View original →
tweetが示したこと
Perplexityは最新のmodel workをchat styleではなくsearch qualityとして説明した。中心になるquoteは Our SFT + RL pipeline improves search, citation quality, instruction following, and efficiency. With Qwen models, we match or beat GPT models on factuality at a lower cost. だ。
Perplexity accountは、AI searchのproduct release、app update、research noteを投稿する公式チャネルである。このtweetが重要なのは、training recipe、evaluation target、比較対象を同時に示している点だ。supervised fine-tuningとreinforcement learningで調整したQwen modelsが、factualityとcostでGPT modelsと競うという主張である。
なぜ意味があるか
search-augmented assistantの失敗は、一般的なchat benchmarkでは見えにくい。回答は滑らかでもsourceが弱い、新しいdocumentを拾えない、安価で済むqueryに高価なmodelを使う、といった問題が起こる。Perplexityのclaimは、search behavior、citation quality、instruction following、efficiencyというproduction変数を同時に扱っている。
FxTwitter metadataで確認できる範囲では、このtweetにはpublic paper、repo、blog URLは付いておらず、media attachmentだけがある。したがって結果はPerplexityによるcompany-reported benchmarkとして扱うべきで、外部検証まではmethodを断定しない方がよい。それでもsignalは明確だ。Qwen系open modelsが、単なるcheap inference backendではなく、closed GPT-class systemsとfactuality layerで競うtrainable search modelとして位置づけられている。
buildersが次に見るべき点はmethodである。どのfactuality datasetか、citationはhuman reviewかautomatic checkか、改善はretrieval policy由来かanswer-model fine-tuning由来か。costもper query、per token、successful answer、latency targetのどれで測ったかが必要だ。technical write-up、model card、またはreal user trafficへのrouting変更が次の確認材料になる。
Source: X source tweet
Related Articles
AIモデル比較で知られるArenaが、商用評価サービスの開始から8カ月で年換算$100Mの売上規模に到達した。1,000万件超のユーザー評価が、モデル研究所と企業向けの有料インフラになりつつある。
高性能モデルの競争軸が、最高点だけでなく費用対効果へ移っている。Claude Opus 5はFable 5に近いcoding・知識作業性能を掲げ、API価格は入力$5/M・出力$25/M tokensに据え置かれた。
大規模コードのセキュリティ解析では、最高精度だけでなく実行単価が重くなる。Malte Ublは非公開Deepsec評価でGPT-5.6 Solが最高の再現率・精度だった一方、実行費用は次点の7倍超だったと述べた。