ZeroLeaks、ローカルでのプロンプトインジェクション検出向け「Shield Small」をリリース
ZeroLeaksは、CPU上でローカルにプロンプトインジェクションやジェイルブレイクを検出する軽量な1億1800万パラメータの分類器「Shield Small」をリリースしました。
英語の原文から自動翻訳されました。
ZeroLeaksは、AIアプリケーションにおけるプロンプトインジェクションやジェイルブレイクの試みを検出するために設計されたコンパクトな分類器「Shield Small」をリリースしました。2026年10月2日に公開されたこのモデルは、標準的なCPU上で完全にオフラインで動作し、エージェントに到達する前に信頼できないテキストをスクリーニングするための低遅延な手段を開発者に提供します。
何が起きたか
Shield Smallは、intfloat/multilingual-e5-smallアーキテクチャに基づく1億1800万パラメータのモデルです。合計約118 MBのint8 ONNX重みを使用しており、専用GPUハードウェアを必要とせずにアプリケーションコードと一緒にデプロイできるほど小型です。このモデルは二値分類器として機能し、入力テキストを「無害」または「インジェクションの試み」としてラベル付けし、各予測に対する信頼度スコアを提供します。
このリリースは、エージェントが検索されたドキュメント、ツール結果、または隠された指示を含む可能性のあるユーザーメッセージを処理するエージェンティックワークフローにおける重要なギャップをターゲットにしています。ローカルで実行することで、分類器はこれらの入力をリアルタイムで検査することを可能にします。システムは二値判定とインジェクションスコアの両方を返し、コンテンツをブロックするかレビューするかという最終判断はアプリケーション開発者に委ねられます。
S15eと名付けられたこのバージョンは、セキュリティスクリーニングのための非商用ベースラインを提供することに焦点を当てた取り組みを表しています。サンプルコードはMITライセンスですが、モデル重み自体はCC BY-NC 4.0の下でリリースされており、商用利用にはZeroLeaksからの個別ライセンスが必要です。この区別は、研究や個人プロジェクトではアクセスしやすいが、エンタープライズ展開では管理されるという、このリリースの二面性を浮き彫りにしています。
仕組み
このモデルは、二値分類ヘッドを持つ12層BERTエンコーダとして動作します。256トークンのウィンドウでテキストを処理し、より長い入力に対してスライドさせるために192トークンのストライドを使用します。特定の入力に対しては、最大32ウィンドウをスキャンし、見つかった最も高いインジェクションスコアを返します。このスライディングウィンドウアプローチにより、大きなドキュメント内の局所的な攻撃がグローバル平均化で見逃されることがなくなります。
提供されているPython例を使用する場合、システムは完全な入力をトークン化します。テキストが6,206トークンを超える場合、分類器は最初の28ウィンドウと最後の4ウィンドウを確認し、中間部分をスキップします。このような場合、結果にはcoverage.truncated: trueフラグが含まれます。開発者は、省略された中間部分が分析されていないため、切り詰められたテキストでフラグが付いていない結果を「安全」ではなく「不確定」として扱う必要があります。
推論パイプラインはシンプルです。Hugging Face Hub経由でモデルをダウンロードした後、開発者はShieldSmallクラスを初期化し、分類用の文字列を渡すことができます。出力にはブール型のflaggedステータスと数値のscoreが含まれます。フラグ付けのデフォルト閾値は0.5ですが、感度と誤検知のバランスを取るために、特定のアプリケーショントラフィックに基づいてこの値を調整することがドキュメントで推奨されています。
主要な詳細
- モデルサイズ: 1億1800万パラメータ、118 MBのint8 ONNX重み。
- アーキテクチャ:
intfloat/multilingual-e5-smallから派生した12層BERTエンコーダ。 - パフォーマンス: Shieldルールv2と組み合わせると、カテゴリバランス平均精度84.3%、攻撃リコール71.8%を報告。
- 入力処理: 192トークンのストライドで256トークンのウィンドウを処理; 6,206トークンを超える入力は切り詰められる。
- ライセンス: 重みはCC BY-NC 4.0(非商用); サンプルコードはMITライセンス。
- デプロイ: Python 3.11または3.12を使用してCPU上でオフラインで実行。
なぜ重要なのか
エージェンティックシステムを構築するエンジニアにとって、プロンプトインジェクションは従来のファイアウォールでは対処できない持続的な脅威です。これらの攻撃は、検索されたWebページやカスタマーサポートチケットなど、一見無害なデータの中に悪意ある指示を組み込みます。Shield Smallは、データ取り込みとエージェント処理の間に位置する専用の防御層を提供し、チームが危険な入力がモデルの挙動に影響を与える前にフィルタリングできるようにします。
この分類器をCPU上でローカルに実行できる能力は、コストと遅延において重要です。多くの既存のセキュリティソリューションは外部サービスへのAPI呼び出しを必要とし、依存関係リスクや潜在的なデータプライバシー懸念を導入します。スクリーニングプロセスを内部かつオフラインに保つことで、組織はデータフローに対するより厳格な管理を維持しつつ、インフラストラクチャへの計算オーバーヘッドを最小限に抑えることができます。
しかし、このツールは万能薬ではありません。報告された7.2%の誤検知率は、正当なセキュリティ議論や複雑なクエリが時々フラグ付けされる可能性があることを示しています。さらに、ほとんどの訓練データが英語であるため、モデルのパフォーマンスは言語によって異なります。開発者は、この分類器をアクセス制御やツールポリシーを含むより広範なセキュリティ戦略の一部として統合する必要があり、唯一の防御メカニズムとして頼るべきではありません。
やれること
- Hugging FaceからS15e重みをダウンロードし、ユーザー入力の独自データセットに対して分類器をテストしてください。
- 誤検知と見逃しの許容範囲に基づいて、決定閾値を0.5以上または以下に調整してください。
- 6,206トークンを超えるテキストを拒否または手動でレビューすることにより、切り詰められた入力を処理するロジックを実装してください。
- 正確なスコアリングを確保するために、HTMLまたは構造化ドキュメントからプレーンテキストを抽出してから分類器に渡してください。
- アプリケーションのトラフィックに基づいて感度と誤検知のバランスを取るために、閾値を調整してください。


