27Bモデルがスマホで動くなら、非公開データをクラウドへ出さないAI利用の幅が広がる。RunAnywhereはBonsaiが1-bit重みで3.9GBに収まり、自社評価で全精度品質の約90%を保つと述べた。
#on-device-ai
RSSフィードAppleが公開していなかったSpeechAnalyzerの精度を同一環境で測ったベンチマークが注目を集めた。旧APIだけでなくWhisper Smallより低い単語誤り率を示した点が焦点だ。
Googleのon-device最適化は、配備済みモデルを再学習せず速度だけを上げる設計だ。Pixel 9・10のGemini Nano v3にfrozen Multi-Token Predictionを追加し、token生成50%以上、standalone drafter比130MB削減を示した。
Show HNに投稿されたParlorは、ブラウザの音声とカメラ入力をGemma 4 E2BとKokoroで処理し、ローカルで音声応答まで完結させる。Apple M3 Proで約2.5〜3.0秒のend-to-end latencyを示している点が印象的だ。
LocalLLaMA で話題になった PokeClaw は、LiteRT-LM 経由で Gemma 4 を Android 端末上にローカル実行し、tap、swipe、text input、app 起動、message 送信、auto reply を cloud なしで処理する open-source mobile agent prototype だ。
Launch HNスレッドはRunAnywhereのMetalRTとRCLIを押し上げ、Apple Silicon上でSTT・LLM・TTSをクラウドなしでつなぐ低遅延音声AIスタックに注目を集めた。
r/LocalLLaMAで注目されたVoiceShelfは、Kokoro TTSを使ってEPUBをAndroid device上で完全offlineの音声に変えるappだ。このprojectは、mobile inferenceにおけるthroughput、APK size、thermal behaviorが実用的なoffline AI productをどう左右するかをよく示している。
Show HNで紹介されたOff Gridは、Android/iOS上でチャット、画像生成、Vision、音声認識をクラウド送信なしで実行するオープンソースアプリだ。