反応は「ブラウザだけでローカルLLM」という手軽さと、WebGPU、モデルの正体、制限条件への補足に分かれた。
#webgpu
RSSフィードLocalLLaMAが反応したのは、demoの分かりやすさだった。約290MBの1.7B Bonsai modelがWebGPUでbrowser内に走る。同じthreadはすぐにtokens per second、hallucination、llama.cpp support、そして1-bit modelがnarrow task以外で使えるのかを確認しにいった。
Show HN で取り上げられた Gemma Gem は、Chrome extension の中で Gemma 4 を WebGPU でローカル実行し、page 読み取り、click、type、scroll、screenshot、JavaScript 実行までを client 側で完結させる on-device browser agent だ。
Cohereは2026年3月28日、Transcribeがreal-world noise環境でspeech recognition accuracyの新しい基準を示すと述べ、試用リンクを共有した。関連するHugging Face資料ではApache 2.0の2B-parameter・14-language ASR modelとして位置づけられ、別のWebGPU demoはこのmodelがbrowser上でローカル動作することを示している。
LocalLLaMAのpostは、Liquid AIのLFM2-24B-A2BがM4 Max browserで約50 tokens per secondと主張し、79 pointsと11 commentsを集めた。communityの関心はsparse MoE architecture、ONNX packaging、そしてWebGPUがlocal AI deployment targetをどこまで広げるかに向かった。
CanIRun.aiはWebGL、WebGPU、navigator APIを使ってbrowser内でGPU、CPU、RAMを検出し、どの quantized model が手元の machine に合うかを推定する。HNでは発想を歓迎する声が多かった一方、欠けている hardware 項目、保守的な推定値、model 起点の逆引き機能を求める声も出た。
Transformers.jsとWebGPUを使用してQwen 3.5 0.8Bモデルをサーバーなしでブラウザ上で完全実行するデモがr/LocalLLaMAでスコア440を獲得しました。インストールもAPIキーも不要で、GPUアクセス可能な最新ブラウザだけで動作します。