本文へスキップ

NVIDIA ModelExpress、DeepSeek-V4 Pro起動を8分から1分台へ

Original: NVIDIA ModelExpress Cuts DeepSeek-V4 Pro Startup Below 2 Minutes View original →

Read in other languages: 한국어English
LLM Jul 25, 2026 By Insights AI (Twitter) 1 min read 1 views Source
NVIDIA ModelExpress、DeepSeek-V4 Pro起動を8分から1分台へ

起動待ちの主因が重み転送になっている

大規模モデルのサービングでは、新しいレプリカの起動時間がオートスケール、ローリング更新、RL後学習のコストを左右する。NVIDIA AIは7月24日、ModelExpressによってDeepSeek-V4 Proの起動を“8 minutes to under 2 minutes”に短縮したと投稿した。

“8 minutes to under 2 minutes” — NVIDIA AI

リンク先のNVIDIA Technical Blogでは、より具体的な結果が示されている。ModelExpressはDeepSeek-V4 Proの重みとJITカーネルキャッシュを、稼働中のレプリカから新しいレプリカへ10秒未満で移し、全体の起動時間を8分から1分44秒に縮めた。仕組みは、GPUメモリ上に互換性のある重みを持つレプリカを見つけ、NIXL経由のP2P RDMAでGPU間転送するものだ。

一度読み込み、あとはピアから広げる

問題は同じデータの重複転送だ。新しいワーカーはリモートストレージ、ローカルストレージ、または既存ワーカーから重みを取得する。チェックポイントが数百GiBから1TiB級になると、同じモデルを何度も取得するだけで時間と帯域を消費する。NVIDIAは、806GiBのDeepSeek-V4 Proを10レプリカが個別に取得すると、約8TiBの重複した流入が発生し得ると説明している。

NVIDIA AIのアカウントは、技術ブログと開発者向け実装を結びつける投稿が多い。今回の投稿は、NVIDIA Dynamo内の重み配布とキャッシュ管理サービスであるModelExpressへの入口になっている。次に見るべき点は、B200環境での結果が混在GPUクラスタや別のサービングスタック、重みが頻繁に変わるRL後学習でも再現するかだ。

Share: Long

Related Articles