AIで開発する

JevShield、型付き判断を用いてローカルでプロンプトインジェクションをブロック

新しいオープンソースツールはOllamaとNimbleを使用し、生成テキストではなく構造化データでプロンプトインジェクションを検出し、セキュリティチェックをローカルに保持します。

英語の原文から自動翻訳されました。

開発者Rajat Rao氏は2026年10月1日、大規模言語モデル(LLM)エージェントをプロンプトインジェクション攻撃から保護するために設計されたオープンソースのセキュリティレイヤー「JevShield」をリリースしました。このプロジェクトは完全にローカルインフラストラクチャ上で動作し、Ollamaの決定モデルAPIとNimbleモデルを活用して、コンテンツが主要なアプリケーションロジックに到達する前に評価を行います。

何が起きたか

JevShieldは、信頼できない外部コンテンツを処理する必要のあるLLMエージェント向けに特化して構築されたファイアウォールを導入します。従来のセキュリティアプローチでは、多くの場合、生成モデルに対してテキストベースの判断(例えば、プロンプトが悪意あるものかどうかに対するはい/いいえの回答)を出力させることが求められます。この方法では、アプリケーションが自由形式のテキストを解析する必要があり、脆弱でエラーが発生しやすい傾向があります。JevShieldはこのパターンを、自然言語ではなく型付きデータを返す構造化決定エンジンに置き換えます。

このシステムは、5つの特定の脅威カテゴリーを検出するように設計されています:直接プロンプトインジェクション、間接プロンプトインジェクション、ジェイルブレイク、データ流出試行、および悪意あるツール操作です。ユーザー入力や取得されたドキュメントがエージェントに影響を与える前にインターセプトすることで、このツールは「信頼できないテキストは実行可能な指示としてではなく、データとして扱うべきである」という原則を強制することを目指しています。リポジトリには、ベンチマークスイート、可視化用のStreamlitダッシュボード、および既存のPythonアプリケーションへの統合用FastAPIインターフェースが含まれています。

仕組み

コアメカニズムは、標準的なチャットまたは生成エンドポイントではなく、OllamaのJevスタイルの決定API、特に/v1/systemoneエンドポイントに依存しています。コンテンツが届くと、JevShieldはそれをNimbleモデルに送信し、複数のセキュリティ次元を同時に評価します。文を生成する代わりに、モデルは選択肢、スコア、およびnoul値を含む構造化オブジェクトを返します。スコアは範囲内の期待されるインデックスを表し、noul値は0から1の間での直接的な確率推定を提供します。

これらの構造化出力は、決定論的なPythonポリシーエンジンにフィードされます。エンジンはリスクを正規化し、設定可能な閾値を適用して最終的な決定を下します。最大正規化リスクが0.50未満の場合、コンテンツは許可されます。0.50から0.85の間の場合、レビューのためにフラグが立てられます。リスクスコアが0.85以上の場合、ブロックがトリガーされます。この分離により、確率的モデルが証拠を提供し、決定論的コードがセキュリティポリシーを強制することが保証されます。また、システムはテイント(汚染追跡)を追跡し、信頼できないと識別されたコンテンツが特権操作から隔離されたままになることを確保します。

主要な詳細

  • ローカル推論のためにNimbleモデルとともにOllamaの/v1/systemoneエンドポイントを使用します。
  • 直接注入、間接注入、ジェイルブレイク、流出、およびツール操作を検出します。
  • 生成テキストではなく、choice、score、noulなどの型付き決定を返します。
  • レビュー用に0.50、ブロック用に0.85というデフォルトの閾値を持つ決定論的なPythonポリシーを適用します。
  • エバリュエーターの失敗により、デフォルトでリクエストがブロックされるfail-closed(安全側停止)動作を提供します。
  • 統合と監視のためのStreamlitダッシュボードとFastAPI RESTエンドポイントを提供します。

なぜ重要なのか

メール、ウェブサイト、データベースなどの外部データソースと対話するAIエージェントを構築するエンジニアにとって、プロンプトインジェクションは依然として重大な脆弱性です。特に、悪意ある指示が取得されたドキュメント内に隠されている間接注入は、エージェントがドキュメントの内容を自身の指示セットの一部として解釈する可能性があるため、緩和が特に困難です。JevShieldは、メインエージェントがコンテンツを処理する前に、コンテンツの出所とリスクを評価するセキュリティ境界を作成することでこれに対処します。これにより、開発者は外部入力を信頼できるコマンドとしてではなく、潜在的に敵対的なデータとして扱うことができます。

生成的な判断から型付き決定への移行は、信頼性も向上させます。セキュリティモデルからの自然言語応答を解析することは、曖昧さと潜在的な障害点を導入します。構造化データ型を使用することで、アプリケーションは他のバックエンドロジックと同じ精度でセキュリティ評価を処理できます。さらに、Ollamaを通じてこれらのチェックをローカルで実行することで、機密データがインフラストラクチャ外に出ないことを保証し、クラウドベースのセキュリティAPIに関連するプライバシー懸念に対処します。このアーキテクチャは、最小権限などの他のコントロールを補完する多層防御戦略をサポートします。

重要なポイント

  • ローカル推論のためにNimbleモデルとともにOllamaの/v1/systemoneエンドポイントを使用します。
  • 直接注入、間接注入、ジェイルブレイク、流出、およびツール操作を検出します。
  • 生成テキストではなく、choice、score、noulなどの型付き決定を返します。
  • レビュー用に0.50、ブロック用に0.85というデフォルトの閾値を持つ決定論的なPythonポリシーを適用します。
  • エバリュエーターの失敗により、デフォルトでリクエストがブロックされるfail-closed(安全側停止)動作を提供します。
  • 統合と監視のためのStreamlitダッシュボードとFastAPI RESTエンドポイントを提供します。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

すべての記事