ProvenanceGuard überprüft die Quellenzuordnung in MCP-Agenten
Eine neue Verifizierungsebene erkennt, wenn KI-Agenten Fakten der falschen Datenquelle zuordnen, und verhindert so eine Vermischung von Quellen in Multi-Tool-Workflows.
Automatisch aus dem englischen Original übersetzt.
Forscher haben ProvenanceGuard vorgestellt, eine Verifizierungsmethode, die sicherstellen soll, dass KI-Agenten Fakten den korrekten Datenquellen zuordnen. Dieser am 29. September 2026 von Hugging Face veröffentlichte Ansatz adressiert Fehler, bei denen wahre Aussagen im Rahmen des Model Context Protocol (MCP) dem falschen Tool-Ausgang zugeordnet werden.
Was passiert ist
Moderne KI-Agenten nutzen häufig das Model Context Protocol, um gleichzeitig auf mehrere Tools zuzugreifen. Ein Agent könnte beispielsweise eine Datenbank abfragen, ein Dokumentenarchiv durchsuchen und strukturierte Datensätze prüfen, bevor er eine einzige Antwort generiert. Während bestehende Bewertungsmethoden prüfen, ob eine Aussage durch irgendein verfügbares Beweismittel gestützt wird, verifizieren sie oft nicht, ob die Aussage tatsächlich durch die spezifische Quelle gestützt wird, die der Agent angibt. Dies führt zu einem Fehlermodus, der als Cross-Source-Conflation (Quellenvermischung) bekannt ist, bei dem eine Tatsache zwar wahr, aber der falschen Herkunft zugeordnet ist.
ProvenanceGuard fungiert als nachgelagerte Verifizierungsebene, die auf einem MCP-Agenten sitzt, ohne dass ein erneutes Training erforderlich ist. Das System analysiert die aufgezeichneten Spuren der Tool-Ausgaben und Quell-IDs, um festzustellen, ob jede Aussage in der Antwort mit ihrer angegebenen oder implizierten Quelle übereinstimmt. Dabei zerlegt es Antworten in einzelne Aussagen, leitet jede Aussage an die relevanteste Quelle weiter und prüft die Unterstützung anhand von Modellen für natürliche Sprachinferenz (NLI). Wird eine Diskrepanz erkannt, kann das System die Antwort blockieren oder einen Reparaturprozess auslösen.
Die Forscher testeten diese Methode an einem medizinischen Agenten, der auf Patientenakten und Forschungsartikel zugriff. In einer Studie mit 281 realen Traces bewerteten menschliche Experten 361 Aussagen aus einem separaten Testdatensatz. ProvenanceGuard identifizierte 138 von 139 Aussagen, die aufgrund falscher Zuordnung oder fehlender Unterstützung hätten verworfen werden müssen. Es erreichte einen F1-Score für Ablehnung/Blockierung von 0,802 und übertraf damit quellblinde Baselines wie MiniCheck und RAGAS Faithfulness, während es gleichzeitig quellenbezogene Urteile pro Aussage lieferte.
Wie es funktioniert
ProvenanceGuard bewahrt die Identität der Quellen während der gesamten Verifizierungspipeline, anstatt alle Beweismittel in einem einzigen Kontext zusammenzuführen. Wenn ein Agent eine Antwort erzeugt, zerlegt das System diese in spezifische Aussagen. Anschließend nutzt es Embedding-Modelle wie MiniLM, um die für jede Aussage relevanteste Quelle zu finden. Ein DeBERTa-NLI-Modell prüft, ob diese spezifische Quelle die Aussage tatsächlich unterstützt. Abschließend vergleicht das System die unterstützende Quelle mit der im Antworttext genannten oder implizierten Quelle.
Der Verifizierungsprozess umfasst einen kalibrierten Entscheidungsschritt, der diese Signale kombiniert, um die Antwort zuzulassen oder zu blockieren. Falls eine Antwort blockiert wird, kann ein Reparaturloop ähnlich wie bei RARR versuchen, eine quellengestützte Überarbeitung vorzunehmen oder eine sichere Ausweichlösung bereitzustellen. In der berichteten lokalen Konfiguration fügt dieser Prozess pro Antwort etwa eine halbe Sekunde Overhead hinzu. Das System verlässt sich auf lokale Modelle für kontrollierte Offline-Verarbeitung, wobei die Architektur auch für Cloud-basierte Dienste angepasst werden kann.
Wichtige Details
- ProvenanceGuard erkennt Cross-Source-Conflation, bei der eine wahre Tatsache dem falschen Tool-Ausgang zugeordnet wird.
- Das System erreichte einen F1-Score von 0,802 beim Blockieren inkorrekter Aussagen und übertraf damit quellblinde Verifizierer.
- In Tests mit unterschiedlichen Quellen identifizierte es in etwa 86 % der Fälle korrekt die richtige Quelle für die Aussagen.
- Die Verifizierungsebene fügt im getesteten lokalen Setup rund 500 Millisekunden Latenz pro Antwort hinzu.
- In einem kontrollierten Test mit 50 vertauschten Quellenzuordnungen erkannte die Methode alle 50 Fehler.
- Der Ansatz funktioniert mit bestehenden MCP-Agenten, indem er Traces analysiert, ohne dass ein Modell-Retraining erforderlich ist.
Warum das wichtig ist
Für Entwickler, die zuverlässige Document-AI-Systeme bauen, reicht die Sicherstellung der faktischen Genauigkeit nicht aus, wenn die Herkunft falsch ist. In sensiblen Bereichen wie dem Gesundheitswesen oder Finanzsektor kann die Zitierung eines allgemeinen Policy-Dokuments anstelle einer spezifischen Patientenakte zu schwerwiegenden Compliance-Problemen oder Sicherheitsrisiken führen. Quellenbewusste Verifizierung bietet die Granularität, die nötig ist, um automatisierten Agenten in hochriskanten Umgebungen zu vertrauen. Sie wandelt Faktizität von einer binären Prüfung in ein detailliertes Audit-Trail um, das jede Aussage mit ihrem Ursprung verknüpft.
Diese Methode verbessert zudem das Debugging und die Wartung agentischer Workflows. Indem sie offenlegt, welches Tool-Ergebnis jede Aussage stützt, können Ingenieure schwache Glieder in ihren Retrieval-Pipelines identifizieren. Teams können so zwischen einem Agenten unterscheiden, dem Informationen fehlen, und einem, der Informationen falsch zuordnet. Diese Unterscheidung ist entscheidend für die Verfeinerung von Prompt-Strategien und die Auswahl geeigneter Tools für spezifische Aufgaben.
Was Sie tun können
- Implementieren Sie das Tracking von Quell-IDs in Ihren MCP-Tool-Ausgaben, um nachgelagerte Verifizierungen zu ermöglichen.
- Evaluieren Sie Ihr aktuelles RAG- oder Agentensystem auf Cross-Source-Conflation unter Verwendung von separaten Testdatensätzen.
- Erwägen Sie die Hinzufügung eines nachgelagerten Verifizierungsschritts, der die Übereinstimmung von Aussage und Quelle prüft.
- Nutzen Sie lokale NLI-Modelle für das erste Prototyping der quellenbewussten Verifizierung, bevor Sie auf Cloud-Dienste skalieren.
- Gestalten Sie Ihre Agenten-Prompts so, dass sie die Quelle jeder Aussage explizit angeben, um automatisierte Prüfungen zu erleichtern.
- Testen Sie Ihr System mit vertauschten Quellenzuordnungen, um dessen Empfindlichkeit gegenüber Herkunftsfehlern zu messen.



