腐食中
DeepSeek V4公開 — 1兆パラメータ・100万トークンコンテキストのオープンウェイトモデル
DeepSeekの最も野心的なリリース
中国AI企業DeepSeekが旧正月の2月17日にDeepSeek V4を公開した。1兆パラメータ、100万トークンコンテキスト、そして3つのアーキテクチャ革新——mHC(Manifold-Constrained Hyper-Connections)、Engramメモリ、Sparse Attention——を搭載したオープンウェイトモデルだ。
技術的ハイライト
- mHCアーキテクチャ: Transformerの根本的な安定性問題を解決し、大規模学習を改善
- Engramメモリ: 長文コンテキストをセッションを超えて効率管理
- Sparse Attention: 推論コストを削減しながら長いコンテキストを処理
- 100万トークン: コードベース全体を1パスで処理可能
ベンチマーク主張
DeepSeek社内ベンチマークによると、V4はコーディングタスクでClaude 3.5 SonnetとGPT-4oを上回り、SWE-benchで80%超のスコアを記録したという。推論コストは欧米の競合フロンティアモデルと比べて10〜40倍低いと主張する。
コンシューマーハードウェアで動作
オープンウェイトとして公開されたV4はNVIDIA RTX 4090デュアル、または単体RTX 5090での動作を想定して設計されており、クラウドインフラなしで最先端のコーディングAIを利用できる。世界中の開発者がすぐにダウンロードして活用可能だ。
Related Articles
LLM Mar 3, 2026 1 min read
中国のAI研究所DeepSeekが今週中にフラッグシップモデルV4をリリースする見込みだ。1兆パラメータのネイティブマルチモーダル構成でHuawei AscendチップをメインにNvidiaとAMDを完全に排除した設計が注目される。
LLM Feb 22, 2026 1 min read
Alibabaは2月16日にQwen 3.5をApache 2.0で公開した。3970億パラメータ(アクティブ170億)のスパースMoEアーキテクチャ、256Kコンテキスト、ネイティブマルチモーダル対応を備え、GPT-5.2と同等のベンチマーク性能を主張する。
LLM Hacker News 5h ago 1 min read
Debianの論点は、AI利用そのものよりも、ライセンス、品質、開示、責任を誰が引き受けるかにある。