AIで開発する

ProvenanceGuard、MCPエージェントにおけるソース帰属を検証

新しい検証レイヤーにより、AIエージェントが事実を誤ったデータソースに帰属させるケースを検出し、マルチツールワークフローにおけるクロスソース混同を防ぎます。

英語の原文から自動翻訳されました。

研究者らは、AIエージェントが事実を正しいデータソースに帰属させることを保証するために設計された検証手法「ProvenanceGuard」を発表しました。2026年9月29日にHugging Faceによって公開されたこのアプローチは、Model Context Protocol(MCP)システムにおいて、真実のステートメントが誤ったツール出力に関連付けられるエラーに対処します。

何が起きたか

現代のAIエージェントは、複数のツールに同時にアクセスするためにModel Context Protocolをよく利用しています。エージェントはデータベースへのクエリ実行、文書リポジトリの検索、構造化レコードの検査などを行い、単一の応答を生成する前にこれらの情報を統合することがあります。既存の評価手法では、主張が利用可能な証拠によって支持されているかどうかを確認しますが、エージェントが引用した特定のソースによってその主張が支持されているかを検証できないことが多くあります。これにより、「クロスソース混同」と呼ばれる障害モードが発生し、事実は正しいものの、誤った起源に帰属されることになります。

ProvenanceGuardは、再学習を必要とせずにMCPエージェントの上に位置するポスト生成検証レイヤーとして機能します。キャプチャされたツール出力とソースIDのトレースを分析し、回答内の各主張が明示的または暗示的なソースと一致するかどうかを判断します。システムは回答を個々の主張に分解し、各主張を最も関連性の高いソースにルーティングして、自然言語推論モデルを使用してサポートの有無を確認します。不一致が検出された場合、システムは回答をブロックするか、修復プロセスを開始できます。

研究者らは、患者記録や研究記事にアクセスする医療用エージェントでこの手法をテストしました。281件の実際のトレースを用いた研究では、人間のエキスパートがホールドアウトセットから361件の主張を評価しました。ProvenanceGuardは、誤った帰属やサポート不足のために拒否すべきであった139件の主張のうち138件を特定しました。MiniCheckやRAGAS Faithfulnessなどのソースブラインドベースラインを上回る0.802のリジェクト/ブロックF1スコアを達成し、主張ごとのソース判定を提供しました。

仕組み

ProvenanceGuardは、すべての証拠を単一のコンテキストにプールするのではなく、検証パイプライン全体を通じてソースの識別性を保持します。エージェントが回答を生成すると、システムはそれを具体的な主張に分解します。その後、MiniLMなどの埋め込みモデルを使用して、各主張に最も関連性の高いソースを探し出します。DeBERTa自然言語推論モデルが、その特定のソースが実際に主張をサポートしているかどうかを確認します。最後に、システムはサポートするソースと、回答テキストで名前が挙げられているか暗示されているソースを比較します。

検証プロセスには、これらのシグナルを組み合わせて回答を許可またはブロックするための校正された決定ステップが含まれます。回答がブロックされた場合、RARRに似たループがソースに基づく改訂を試みたり、安全なフォールバックを提供したりできます。報告されたローカル構成では、このプロセスは回答あたり約0.5秒のオーバーヘッドを追加します。システムは制御されたオフライン処理のためにローカルモデルに依存していますが、アーキテクチャはクラウドベースのサービス向けに適応させることができます。

主要な詳細

  • ProvenanceGuardは、真実の事実が誤ったツール出力に帰属されるクロスソース混同を検出します。
  • システムは誤った主張をブロックするために0.802のF1スコアを達成し、ソースブラインド検証器を上回りました。
  • ソースが明確に区別されるテストにおいて、主張に対する正しいソースを約86%の確率で正しく識別しました。
  • テストされたローカル環境での検証レイヤーは、回答あたり約500ミリ秒の遅延を追加します。
  • 50件のソース帰属を入れ替えた制御テストでは、この手法はすべての50件のエラーを検出しました。
  • このアプローチは、モデルの再学習を必要とせず、トレースを分析することで既存のMCPエージェントでも動作します。

なぜ重要なのか

信頼できるドキュメントAIシステムを開発するエンジニアにとって、プロベナンス(出所)が誤っている場合、事実の正確性だけでは十分ではありません。ヘルスケアや金融などの機密性の高い分野では、特定の患者記録ではなく一般的なポリシー文書を引用することは、深刻なコンプライアンス問題や安全性リスクにつながる可能性があります。ソース認識型の検証は、ハイリスク環境で自動化エージェントを信頼するために必要な粒度を提供します。これは、事実性をバイナリチェックから、すべての主張を出所にリンクする詳細な監査証跡へと変換します。

この手法はまた、エージェント型ワークフローのデバッグとメンテナンスも改善します。どのツール出力が各主張をサポートしているかを明らかにすることで、エンジニアは検索パイプラインの弱点を特定できます。これにより、情報を持たないエージェントと、情報を誤って帰属させるエージェントを区別できるようになります。この区別は、プロンプト戦略の洗練や、特定のタスクに適したツールの選択にとって極めて重要です。

実施できること

  • MCPツール出力にソースIDトラッキングを実装し、ダウンストリームでの検証を可能にします。
  • ホールドアウトテストセットを使用して、現在のRAGまたはエージェントシステムのクロスソース混同を評価します。
  • 主張とソースの整合性を確認するポスト生成検証ステップの追加を検討します。
  • クラウドサービスへスケールする前に、ソース認識型検証の初期プロトタイピングにローカルNLIモデルを使用します。
  • エージェントのプロンプトを設計し、各主張のソースを明示的に記述して自動チェックを容易にします。
  • ソース帰属を入れ替えてシステムをテストし、プロベナンスエラーに対する感度を測定します。

Bytechapストアのツール

続きを読む

すべての記事