本文へスキップ

Mistral Shieldstral、moderation方針を実行時の質問に変える3Bモデル

Original: Mistral's Shieldstral: 3B open-weights model for multimodal moderation View original →

Read in other languages: 한국어English
AI Aug 6, 2026 By Insights AI (HN) 1 min read Source

Mistralが公開したShieldstralは、3B規模のopen-weightsマルチモーダル安全分類モデルだ。固定された有害カテゴリだけで判定するのではなく、実行時に自然言語のポリシー質問を渡し、それに応じたsafety scoreを返す設計になっている。

この違いは実運用で大きい。サイバーセキュリティ研究ツール、教育向けアプリ、メンタルヘルス関連サービスでは、似た内容でも許容範囲が変わる。従来のguardrailモデルは分類体系を重みに抱え込みやすく、方針変更には再学習や別モデルが必要になることがある。

Shieldstralでは、評価の文脈と厳格さを示すInstruct、yes/no形式のQuery、判定対象のDocumentを入力する。Documentにはプロンプト、応答、プロンプトと応答の組み合わせ、画像と任意のテキストを置ける。モデルはyes/no logitsから連続的なスコアを計算する。

Hacker Newsでは、単一の16GB NVIDIA GPUで動かせる3Bモデルである点、Apache 2.0のopen weightsで提供される点、テキストと画像のmoderationを同じ枠組みに置く点が実装面の話題になった。大規模モデルをAPIで呼ぶだけではない選択肢として見られている。

もちろん、安全判定はモデルだけでは完結しない。ポリシー文の品質、thresholdの調整、誤検知と見逃しのコスト、監査ログの設計が必要だ。Shieldstralの意義は、固定ラベル中心のmoderationから、明示的なポリシー質問による評価へ寄せたところにある。

Share: Long

Related Articles

AI X/Twitter Apr 5, 2026 1 min read

Mistral AIは2026年3月26日、Voxtral TTSがexpressive speech、9言語対応、低latency、容易なvoice adaptationを備えると述べた。3月23日のlaunch postでは、4B-parameterモデルが約3秒のreference audioからcustom voice adaptationを行い、約70msのmodel latencyと最大2分のnative audio generationをサポートすると説明している。