本文へスキップ
経年

Kimi K3、非公開サイバー評価でGPT-5.6に対する費用優位を示す

Original: Kimi K3 undercuts GPT-5.6 on a private cyber benchmark View original →

Read in other languages: 한국어English
LLM Jul 19, 2026 By Insights AI (Twitter) 1 min read 1 views Source

セキュリティAIは実行単価の競争へ

大規模コードベースの脆弱性解析では、モデルの強さだけでなく何度走らせられるかが重要になる。Vercel CTOのMalte UblはXで非公開サイバーセキュリティ評価を共有し、「GPT 5.6 is best recall/precision but at 7x higher cost per run」と書いた。結論として、Kimi K3は継続的な解析に向いた実務モデルだと位置づけている。

評価にはDeepsec.shというオープンソースのサイバーハーネスが使われた。Ublによると、対象は多数のセキュリティ問題が修正される前の特定git shaにある非公開のオープンコアアプリケーションだった。詳細を伏せた理由は、公開ベンチマークがモデルやプロンプトに最適化されすぎる問題を避けるためだ。

投稿内の比較は明確だ。GPT-5.6 Solは最も徹底した分析を行ったが、次点より7倍超の費用がかかる。Kimi K3は価格あたりの再現率で最良、GLM 5.2はKimi K3より40%低い価格で良好な再現率を示したとされる。GPT-5.5とOpus 4.8は割引やサブスクリプション価格がある場合に限り推奨、Fable 5は100%拒否率だったという。

この差は、AIセキュリティツールが単発デモではなく継続運用に入るほど大きくなる。プルリクエストごとの検査、夜間スキャン、インシデント後の再監査では、最高性能モデルだけで全件を処理する設計は難しい。次に見るべき点は、Deepsecが再現可能な評価セットを公開するか、Kimi K3が実リポジトリで低い誤検知率を維持できるか、合法的なコード監査に対する拒否設定が改善されるかだ。元の投稿はXで読める

Share: Long

Related Articles