AIニュース

Mistral AI、ポリシーを自然言語で指定できる軽量な安全性判定モデル「Shieldstral」をオープンソース公開

公開日: ・出典: Mistral AI公式ブログ

フランスのAIスタートアップMistral AIは、コンテンツの安全性を判定する軽量モデル「Shieldstral」を発表し、Hugging Face上でApache 2.0ライセンスの下オープンウェイトとして公開しました。パラメータ数は30億とコンパクトながら、16GBのGPU1枚で動作する設計です。

従来の安全性判定モデルの多くは、あらかじめ定義された有害カテゴリーの分類器として学習されており、判定基準を変えるにはモデルの再学習が必要でした。Shieldstralはこれとは異なり、「この内容は特定のポリシーに違反しているか」という質問と評価対象(プロンプト、応答、あるいは画像とテキストの組み合わせ)を入力として与える方式を採用し、開発者が自然言語で書いたポリシーをその場で適用できます。これにより、サービスごとに異なる利用規約への対応や、ルール変更への追従が容易になります。

Mistralによれば、Shieldstralはテキストの安全性判定において、自身の7倍規模のオープンモデルと同等かそれを上回る精度を達成し、マルチモーダル(画像を含む)安全性判定でも既存のオープンモデル群を上回るスコアを記録したといいます。AIの出力を監視する「ガードレール」モデルは、生成AIの実運用における重要な基盤技術として注目度を増しており、大手クローズドモデルだけでなく安全性周辺技術でもオープンソース陣営の存在感が高まっていることを示す事例です。

出典: Mistral AI公式ブログ

Xでシェア