大規模モデル運用の待ち時間が重み転送に集約されている。NVIDIAはModelExpressでDeepSeek-V4 Proの起動を8分から1分44秒に短縮した。
大規模モデル運用の待ち時間が重み転送に集約されている。NVIDIAはModelExpressでDeepSeek-V4 Proの起動を8分から1分44秒に短縮した。
注目点は、巨大なMoEモデルを普通のPCで実用的に動かせるのかという現実的な問いだ。ColibriはGLM-5.2の疎な活性化を使い、モデル全体をRAMやGPUへ一度に載せない設計を取る。
RTX PRO 6000を5枚と5090を使った構成は、ローカルLLMの魅力と同時に電力、VRAM、予算の重さを示した。
Etchedは動作するchip、累計$800M調達、$1B超の顧客契約を同時に示した。焦点は単体chipではなく、prefillとdecodeを含むrack-scale推論システムを量産できるかに移っている。
Together AIの$800M Series Cは、open-source modelを安く大規模に動かす基盤が企業AIの主戦場になったことを示す。評価額は$8.3B、前四半期のannual bookingsは$1.15B超、5年でcapacityを約50倍に広げる計画だ。
enterprise AIの詰まりどころは、model accessから運用管理へ移っている。NVIDIAは社内Enterprise Inference Hubが100超のmodel endpointと毎週trillions of tokensを処理すると示した。
LocalLLaMAの関心は、diffusion LLMが品質を保ったまま生成速度を本当に上げられるのかに集まった。
AI競争の焦点は、モデルの性能だけでなく推論をどれだけ安く安定して配れるかに移っている。OpenAIはBroadcomと作ったJalapenoを9カ月でテープアウトし、2026年末から大規模展開を狙う。
HNで注目されたのはモデル性能よりもコスト管理だった。生成AIが試験導入から業務予算に入るにつれ、token単価と利用量が購買判断を左右し始めている。
Alex Ellisの記事は、local LLMをベンチマーク順位ではなく、事業でのコスト、制御、agent運用の信頼性から捉えた点で読まれた。
LocalLLaMAで注目されたのは速度の数字だけでなく、FP4、DFlash、commodity GPU向けkernelが外部でも検証できるかだった。
AI agent基盤の評価軸が、単純なトークン速度から同時セッション数と電力効率へ移っている。NVIDIAはArtificial AnalysisのAA-AgentPerfで、GB300 NVL72がH200よりMWあたり最大20倍のcoding agent処理能力を示したと説明した。