AWSとCerebrasは2026年3月13日、Amazon Bedrock向けの高速inference提供に向けた協業を発表した。AWS Trainiumがprefill、Cerebras CS-3がdecodeを担う分離型構成が中核になる。
#inference
RSSフィードLocalLLaMAの技術スレッドはFlashAttention-4論文を実運用目線で整理し、Blackwellでの大幅な性能向上、Pythonベースkernel開発の高速化、そしてA100やconsumer GPUユーザーが今すぐ恩恵を受けにくい現実を示した。
Cloudflareは3月19日にXで、Kimi K2.5 が Workers AI で利用可能になったと発表した。単なるモデル追加ではなく、agent workload の遅延とコストを下げる platform 改善もセットになった launch だ。
Cloudflareは2026年3月20日、Kimi K2.5をWorkers AIで提供し、agentを自社platform上でend-to-endに実行できるようにしたと発表した。リンク先のCloudflare blogは、256K context、multi-turn tool calling、vision、structured outputsに加え、ある内部agent workloadでコストを77%削減したと説明している。
Hacker Newsで注目を集めたFlash-MoEは、SSDストリーミングとMetalカーネルを使ってQwen3.5-397B-A17Bを48GB M3 MaxノートPCで対話可能な速度まで動かす手法を示した。
Cloudflareは2026年3月20日、Kimi K2.5をWorkers AIに載せ、Cloudflare Developer Platform上でend-to-end agentを構築・運用できると発表した。公式ブログでは256k context、multi-turn tool calling、vision inputs、structured outputsに加え、1日7B tokensを処理する内部security review agentで77%のコスト削減を示している。
2026年3月21日のHacker Newsでは tinygrad の tinybox が再浮上し、rented GPU time の代替として local AI workstation をどう製品化するかが改めて話題になった。具体的な GPU 構成と価格が公開されている点が、on-prem AI を検討する開発者に強い材料を与えている。
NVIDIAは2026年3月17日のGTC 2026で、通信事業者がAI gridを構築し始めていると説明した。latency、cost、data localityが重要なinferenceをnetwork edgeへ近づけ、通信事業者のAI monetization基盤にしようという構想だ。
公開から数週間が経ち、r/LocalLLaMA では Qwen3.5 に対して 1 つの既定値ではなく、task ごとの sampler と reasoning budget を使い分ける方向へ知見が集まりつつある。
2026年3月18日にLocalLLaMAで注目を集めたMamba-3は、Carnegie Mellon University、Princeton、Cartesia AI、Together AIの研究者が公開したstate space modelだ。設計目標をtraining speedからinference efficiencyへ移し、1.5B scaleでMamba-2やGated DeltaNet、Llama-3.2-1Bを上回るprefill+decode latencyを主張している。
MetaはMarch 11, 2026、今後2年でMTIA custom chipの4世代を開発・展開すると発表した。ranking、recommendation、GenAI inference workloadを支えるAI infrastructure戦略の中心にMTIAを据える構えだ。
2026年3月15日のGreenBoostに関するHacker News投稿は124 points、25 commentsに達した。このopen-source Linux projectはkernel moduleとCUDA shimを組み合わせ、model memoryをVRAM、DDR4、NVMeに階層化することで、inference appを変えずにより大きなlocal LLMを動かそうとしている。