Bonsaiが27Bモデルを3.9GB化、スマホ上のローカル推論を現実路線へ
Original: Bonsai squeezes a 27B model into 3.9GB for phones View original →
27Bモデルが端末側に近づく
27B規模の言語モデルは、通常ならサーバー級GPUと大きなメモリを前提に語られる。RunAnywhereのBonsai投稿は、その前提を小さな数字で揺さぶった。同社はXで「1-bit weights, 27B params in just 3.9GB, ~90% of full precision quality」と記し、iPhone、Android、Macで動作すると説明している。
焦点は極端な量子化と端末別の実行経路だ。投稿によれば、iOSとMacではllama.cppとApple MLXを使い、Androidではllama.cppに加えてQualcomm Hexagon NPUへQHexRTで直接載せる。RunAnywhereは、NPU上の1-bit推論を可能にするためカスタムシリコンカーネルを作ったとも述べている。
RunAnywhereはY Combinator W26のオンデバイスAI企業として紹介されており、普段からローカル推論や消費者端末でのAI実行を発信している。今回の投稿はアプリ配信の告知であると同時に、クラウド前提だった大規模モデルを端末側へ寄せる競争の一例だ。ただし、約90%という品質値は同社評価であり、外部ベンチマークではない。
次に見るべき点は、公開ベンチマークで2-bitや4-bitモデルとどこまで競えるか、Qualcomm NPU経路がどのAndroid端末で使えるか、バッテリー消費と遅延が実用域に入るかだ。開発者向けAPIとして開かれるかも重要になる。元の投稿はXで確認できる。
Related Articles
r/LocalLLaMAの反応は、PrismML Bonsai の発表が単なる compression headline 以上に受け止められていることを示している。会社の end-to-end 1-bit 設計の主張と、実際の利用者が感じた使い勝手の改善が同時に語られている。
Googleのon-device最適化は、配備済みモデルを再学習せず速度だけを上げる設計だ。Pixel 9・10のGemini Nano v3にfrozen Multi-Token Predictionを追加し、token生成50%以上、standalone drafter比130MB削減を示した。
エージェントリスクは昨年のブラックメール実験だけではない。Anthropicはコード妨害、詐欺支援、意図的なラベル操作、人間を介した情報開示誘導という4類型を示した。