HNがDeepSeek V4に飛びついた理由はきれいな発表ページではなかった。表のリンクがAPI docsで、実際の重みとbaseモデルがすでにHugging Faceに並んでいたことが一気に火を付けた。
#deepseek
RSSフィードLocalLLaMAが反応したのは新しいスコア画像ではなく、MoEの配管を実際に速くする公開インフラだった。コメントもDeepSeekが通信とカーネルの仕事を外に出した点に熱を持っていた。
13ヶ月の驚くべき比較:2025年初頭にはDeepSeek R1をフロンティアレベルで約5 t/s実行するのに$6,000が必要だったが、今では$600のミニPCでさらに優れたモデルを同じ速度で、もしくは17-20 t/sで実行できる。
フィナンシャル・タイムズによると、DeepSeek V4が来週リリースされる予定で、画像・動画生成機能を搭載し、OpenAIやGoogleのマルチモーダルAIに正面から挑む見通しです。
r/LocalLLaMAで話題になったDualPath論文は、KV-Cacheの読み込み経路を二重化して推論スループットを改善する手法を提示した。arXiv要約では、オフライン最大1.87倍、オンライン平均1.96倍の改善が報告されている。
AnthropicがDeepSeek、Moonshot AI(Kimi)、MiniMaxの3社が24,000件以上の不正Claudeアカウントを作成し、1,600万件の会話から訓練データを無断抽出(distillation)したと告発。AIの知的財産権争いが新たな局面を迎えました。
Anthropicが中国AI企業による2万4,000以上の不正アカウントを使った1,600万件のClaude会話データ抽出攻撃を告発しました。
中国AI企業DeepSeekが旧正月の2月17日にV4を公開。1兆パラメータ、100万トークンコンテキスト、mHCアーキテクチャを備えたオープンウェイトモデルで、コーディングベンチマークでClaude 3.5 SonnetやGPT-4oを超えると主張する。