ProvenanceGuard vérifie l'attribution des sources dans les agents MCP
Une nouvelle couche de vérification détecte lorsque les agents IA attribuent des faits à la mauvaise source de données, empêchant la confusion entre sources dans les flux de travail multi-outils.
Traduit automatiquement depuis l'original anglais.
Des chercheurs ont présenté ProvenanceGuard, une méthode de vérification conçue pour garantir que les agents IA attribuent les faits aux bonnes sources de données. Publiée le 29 septembre 2026 par Hugging Face, cette approche corrige les erreurs où des affirmations vraies sont liées à la sortie du mauvais outil dans les systèmes Model Context Protocol (MCP).
Ce qui s'est passé
Les agents IA modernes utilisent souvent le Model Context Protocol pour accéder simultanément à plusieurs outils. Un agent peut interroger une base de données, rechercher dans un dépôt de documents et inspecter des enregistrements structurés avant de générer une seule réponse. Bien que les méthodes d'évaluation existantes vérifient si une affirmation est soutenue par une preuve disponible quelconque, elles échouent souvent à vérifier si l'affirmation est soutenue par la source spécifique citée par l'agent. Cela conduit à un mode de défaillance connu sous le nom de confusion inter-sources, où un fait est vrai mais attribué à la mauvaise origine.
ProvenanceGuard agit comme une couche de vérification post-génération qui se superpose à un agent MCP sans nécessiter de réentraînement. Il analyse la trace capturée des sorties d'outils et des identifiants de sources pour déterminer si chaque affirmation dans la réponse correspond à sa source déclarée ou implicite. Le système décompose les réponses en affirmations individuelles, dirige chaque affirmation vers la source la plus pertinente et vérifie le soutien à l'aide de modèles d'inférence en langage naturel. Si une discordance est détectée, le système peut bloquer la réponse ou déclencher un processus de réparation.
Les chercheurs ont testé cette méthode sur un agent médical accédant aux dossiers patients et aux articles de recherche. Dans une étude impliquant 281 traces réelles, des experts humains ont évalué 361 affirmations issues d'un ensemble de validation. ProvenanceGuard a identifié 138 des 139 affirmations qui auraient dû être rejetées en raison d'une attribution incorrecte ou d'un manque de soutien. Il a atteint un score F1 de rejet/blocage de 0,802, surpassant les références aveugles aux sources comme MiniCheck et RAGAS Faithfulness tout en fournissant des verdicts de source par affirmation.
Comment cela fonctionne
ProvenanceGuard préserve l'identité de la source tout au long du pipeline de vérification plutôt que de regrouper toutes les preuves dans un seul contexte. Lorsqu'un agent produit une réponse, le système la décompose en affirmations spécifiques. Il utilise ensuite des modèles d'embedding, tels que MiniLM, pour trouver la source la plus pertinente pour chaque affirmation. Un modèle d'inférence en langage naturel DeBERTa vérifie si cette source spécifique soutient réellement l'affirmation. Enfin, le système compare la source de soutien avec celle nommée ou implicite dans le texte de la réponse.
Le processus de vérification inclut une étape de décision calibrée qui combine ces signaux pour autoriser ou bloquer la réponse. Si une réponse est bloquée, une boucle de réparation similaire à RARR peut tenter une révision ancrée sur la source ou fournir une solution de repli sûre. Dans la configuration locale rapportée, ce processus ajoute environ une demi-seconde de surcharge par réponse. Le système repose sur des modèles locaux pour un traitement hors ligne contrôlé, bien que l'architecture puisse être adaptée pour des services basés sur le cloud.
Détails clés
- ProvenanceGuard détecte la confusion inter-sources, où un fait vrai est attribué à la sortie du mauvais outil.
- Le système a atteint un score F1 de 0,802 pour le blocage des affirmations incorrectes, surpassant les vérificateurs aveugles aux sources.
- Il a correctement identifié la bonne source pour les affirmations dans environ 86 % des cas lors de tests avec des sources distinctes.
- La couche de vérification ajoute environ 500 millisecondes de latence par réponse dans la configuration locale testée.
- Lors d'un test contrôlé avec 50 attributions de sources inversées, la méthode a détecté les 50 erreurs.
- L'approche fonctionne avec les agents MCP existants en analysant les traces sans nécessiter de réentraînement du modèle.
Pourquoi c'est important
Pour les développeurs construisant des systèmes fiables d'IA documentaire, assurer l'exactitude factuelle ne suffit pas si la provenance est erronée. Dans des secteurs sensibles comme la santé ou la finance, citer un document de politique générale au lieu d'un dossier patient spécifique peut entraîner de graves problèmes de conformité ou des risques pour la sécurité. La vérification consciente de la source fournit la granularité nécessaire pour faire confiance aux agents automatisés dans des environnements critiques. Elle transforme la factualité d'une vérification binaire en une piste d'audit détaillée reliant chaque affirmation à son origine.
Cette méthode améliore également le débogage et la maintenance des flux de travail agentiques. En exposant quelle sortie d'outil soutient chaque affirmation, les ingénieurs peuvent identifier les maillons faibles dans leurs pipelines de récupération. Cela permet aux équipes de distinguer un agent qui manque d'informations d'un agent qui attribue mal les informations. Cette distinction est cruciale pour affiner les stratégies de prompt et sélectionner les outils appropriés pour des tâches spécifiques.
Ce que vous pouvez faire
- Implémentez le suivi des ID de source dans vos sorties d'outils MCP pour permettre la vérification en aval.
- Évaluez votre système RAG ou agent actuel pour la confusion inter-sources à l'aide d'ensembles de test réservés.
- Envisagez d'ajouter une étape de vérification post-génération qui contrôle l'alignement affirmation-source.
- Utilisez des modèles NLI locaux pour le prototypage initial de la vérification consciente de la source avant de passer à des services cloud.
- Concevez vos prompts d'agent pour qu'ils indiquent explicitement la source de chaque affirmation afin de faciliter la vérification automatisée.
- Testez votre système avec des attributions de sources inversées pour mesurer sa sensibilité aux erreurs de provenance.



