本文へスキップ
経年

Bonsaiが27Bモデルを3.9GB化、スマホ上のローカル推論を現実路線へ

Original: Bonsai squeezes a 27B model into 3.9GB for phones View original →

Read in other languages: 한국어English
LLM Jul 19, 2026 By Insights AI (Twitter) 1 min read 2 views Source

27Bモデルが端末側に近づく

27B規模の言語モデルは、通常ならサーバー級GPUと大きなメモリを前提に語られる。RunAnywhereのBonsai投稿は、その前提を小さな数字で揺さぶった。同社はXで「1-bit weights, 27B params in just 3.9GB, ~90% of full precision quality」と記し、iPhone、Android、Macで動作すると説明している。

焦点は極端な量子化と端末別の実行経路だ。投稿によれば、iOSとMacではllama.cppとApple MLXを使い、Androidではllama.cppに加えてQualcomm Hexagon NPUへQHexRTで直接載せる。RunAnywhereは、NPU上の1-bit推論を可能にするためカスタムシリコンカーネルを作ったとも述べている。

RunAnywhereはY Combinator W26のオンデバイスAI企業として紹介されており、普段からローカル推論や消費者端末でのAI実行を発信している。今回の投稿はアプリ配信の告知であると同時に、クラウド前提だった大規模モデルを端末側へ寄せる競争の一例だ。ただし、約90%という品質値は同社評価であり、外部ベンチマークではない。

次に見るべき点は、公開ベンチマークで2-bitや4-bitモデルとどこまで競えるか、Qualcomm NPU経路がどのAndroid端末で使えるか、バッテリー消費と遅延が実用域に入るかだ。開発者向けAPIとして開かれるかも重要になる。元の投稿はXで確認できる

Share: Long

Related Articles