KI-Agenten

Google Research schlägt kontextuelle Integrität für die Sicherheit autonomer KI-Agenten vor

Ein neuer Bericht von Google Research argumentiert, dass KI-Agenten soziale Normen und Kontexte verstehen müssen, um Privatsphäre und Sicherheit zu gewährleisten – über traditionelle Berechtigungsmodelle hinaus.

Ein Glaswürfel mit digitalen Fäden und Zahnrädern auf einem Schreibtisch mit Dokumenten und einer Lupe.
Für diesen Artikel generierte Illustration

Automatisch aus dem englischen Original übersetzt.

Google Research hat einen umfassenden Workshop-Bericht veröffentlicht, der ein neues Framework zur Absicherung autonomer KI-Agenten skizziert. Das im Oktober 2026 publizierte Dokument mit dem Titel "Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle" bündelt Erkenntnisse von mehr als 50 führenden Persönlichkeiten aus Wissenschaft und Industrie. Der Bericht stellt fest, dass herkömmliche Sicherheitsmodelle für generative Agenten unzureichend sind, und schlägt vor, die Theorie der Kontextuellen Integrität (Contextual Integrity) zu übernehmen, um angemessene Informationsflüsse zu definieren.

Was passiert ist

Der Bericht geht auf den Google Contextual Agent Privacy and Security (CAPS) Workshop zurück, der Ende 2025 in New York City stattfand. Da sich große Sprachmodelle zu Agenten entwickeln, die dynamisch planen und Tools aufrufen können, entstehen einzigartige Risiken, denen deterministische Software nicht ausgesetzt ist. Die Autoren stellen fest, dass Agenten für ihre Nützlichkeit Zugriff auf persönliche Daten benötigen und in verschiedenen Kontexten folgenreiche Aktionen ausführen müssen. Diese Kombination erzeugt eine Spannung zwischen Leistungsfähigkeit und Sicherheit, die aktuelle ingenieurtechnische Praktiken nur schwer lösen können.

Das Kernargument lautet, dass Privatsphäre nicht bloß als Geheimhaltung oder Nutzerkontrolle betrachtet werden sollte, sondern als "angemessener Informationsfluss", basierend auf sozialen Normen. Der Bericht erweitert dieses Konzept, bekannt als Kontextuelle Integrität, sodass es nicht nur das Teilen von Daten abdeckt, sondern auch die Angemessenheit von Agentenaktionen. Durch die Verankerung der Sicherheit in diesen kontextuellen Normen zielen die Forscher darauf ab, Systeme zu schaffen, die bewerten können, ob eine Aktion sozial akzeptabel ist, bevor sie ausgeführt wird, anstatt sich ausschließlich auf statische Berechtigungen zu verlassen.

Wie es funktioniert

Kontextuelle Integrität definiert Privatsphärenormen durch drei Komponenten: Akteure, Informationstypen und Übertragungsprinzipien. Zu den Akteuren gehören die Sender und Empfänger von Informationen. Informationstypen beziehen sich auf spezifische Kategorien wie medizinische oder finanzielle Aufzeichnungen. Übertragungsprinzipien sind die Regeln, die den Fluss steuern, beispielsweise Vertraulichkeit oder Gegenseitigkeit. Ein Beispiel: Ein Nutzer könnte einem Einkaufsassistenten erlauben, eine Geschenkeliste einzusehen, aber nicht, diese mit Freunden zu teilen. Der Bericht legt nahe, dass LLMs die semantische Lücke zwischen hochrangigen Normen und niedrigstufigen Systemberechtigungen schließen können, indem sie maschinenlesbare Richtlinien generieren, die sich in Echtzeit an spezifische Kontexte anpassen.

Um dies operativ umzusetzen, schlägt der Bericht eine mehrschichtige Architektur vor, die auf einer kontextuellen Policy-Engine zentriert ist. Diese Engine fungiert als Supervisor-Ebene, die das Verhalten des Agenten überwacht. Sie umfasst eine Schleife zur dynamischen Policy-Generierung, die Regeln an die Anfrage des Nutzers und den offenen Kontext anpasst, einschließlich neuer Tools, die zur Laufzeit entdeckt werden. Bevor Daten den Arbeitsbereich des Nutzers verlassen, prüft das System, ob der vorgeschlagene Fluss mit den etablierten kontextuellen Normen übereinstimmt. Dieser Ansatz ergänzt modellseitiges Reasoning und nutzerzentrierte Kontrollen, um einen robusten Abwehrmechanismus zu schaffen.

Wichtige Details

  • Der Bericht identifiziert drei kritische Dimensionen, in denen sich Agenten von traditioneller Software unterscheiden: unstrukturierte Schnittstellen, probabilistische Kontrollflüsse und Autonomie mit Delegation.
  • Herkömmliche Testmethoden tun sich schwer damit, generatives Planen abzusichern, da Ausführungspfade probabilistisch statt deterministisch sind.
  • Die Aufsicht durch Nutzer wird weniger effektiv aufgrund von "Bestätigungsmüdigkeit" (confirmation fatigue), wenn Agenten längere Aufgaben bearbeiten und Teilaufgaben an andere Agenten delegieren.
  • Die vorgeschlagene Lösung beinhaltet eine kontextuelle Policy-Engine, die Richtlinien dynamisch generiert, um die Angemessenheit vor der Datenübertragung durchzusetzen.
  • Das systemweite Sandboxing für Agenten muss sich von statischen Limits hin zu dynamischen Fähigkeitsbeschränkungen entwickeln, die auf wechselnden Kontexten basieren.
  • Die Autoren fordern standardisierte Multi-Agenten-Benchmarks, beschrieben als "Agent Gym"-Umgebungen, um komplexe Interaktionen für die Sicherheitsbewertung zu simulieren.

Warum das wichtig ist

Für Ingenieure, die agentische Systeme entwickeln, hebt dieser Bericht die Grenzen aktueller Berechtigungsmodelle hervor. Traditionelle "Notice and Choice"-Frameworks gehen davon aus, dass Nutzer feingranulare Entscheidungen über vorhersehbare Aktionen treffen können. Autonome Agenten operieren jedoch in hoher Frequenz und auf probabilistische Weise, was solche Voraussicht unmöglich macht. Das Verlassen auf statische Berechtigungen oder manuell von Experten erstellte Richtlinien kann nicht skalieren, wenn Agenten komplexe, langlaufende Aufgaben über mehrere Domänen hinweg ausführen. Entwickler benötigen neue Mechanismen, die es Agenten ermöglichen, unter sich ändernden Normen ohne ständige menschliche Intervention über die Angemessenheit zu urteilen.

Der Wandel hin zu kontextueller Sicherheit beeinflusst auch, wie Teams Testing und Governance angehen. Da Agenten bei Multi-Agenten-Interaktionen kolludieren oder Normen verletzen können, sind einfache Unit-Tests unzureichend. Der Bericht betont die Notwendigkeit einer Ökosystem-Governance, um Konflikte zwischen unterschiedlichen Normen über Domänen hinweg zu lösen. Durch die Annahme eines kontextuellen Blickwinkels können Organisationen Vertrauen aufbauen, nicht nur durch die Verhinderung von Datenlecks, sondern auch dadurch, dass sie sicherstellen, dass Agenten in spezifischen Situationen so handeln, dass sie den Nutzererwartungen und sozialen Standards entsprechen.

Was Sie tun können

  • Bewerten Sie aktuelle Agenten-Architekturen, um zu identifizieren, wo statische Berechtigungen die kontextuellen Nuancen bei der Datenverarbeitung nicht erfassen.
  • Prüfen Sie die Implementierung einer Supervisor-Ebene oder Policy-Engine, die Agentenaktionen gegen dynamische kontextuelle Regeln abfangen und validieren kann.
  • Gestalten Sie Benutzeroberflächen so, dass sie sich von einmaligen Einwilligungsdialogen hin zu kontinuierlichen, kontextuellen Kontrollmechanismen bewegen, die den mentalen Modellen der Nutzer entsprechen.
  • Untersuchen Sie Techniken für dynamisches Sandboxing, die Agenten den Zugriff auf Tools und Daten basierend auf Echtzeit-Kontextänderungen entziehen oder gewähren können.
  • Nehmen Sie an der Entwicklung von Multi-Agenten-Simulationsumgebungen teil oder beobachten Sie diese, um Sicherheits- und Privatsphäre-Verhalten in komplexen Szenarien zu benchmarken.
  • Arbeiten Sie mit funktionsübergreifenden Teams zusammen, um klare kontextuelle Normen für spezifische Use Cases zu definieren und dabei Akteure, Informationstypen und Übertragungsprinzipien zu dokumentieren.

Tools aus dem Bytechap-Shop

Weiterlesen

KI-Agenten

Anthropic integriert dauerhaft aktive Cowork-Agenten in Claude

Anthropic hat seinen Agenten für geplante Aufgaben, Cowork, in die Haupt-App von Claude für Pro- und Max-Nutzer integriert. Damit tritt das Unternehmen im Wettrennen um vertrauenswürdige Automatisierung gegen OpenAI Dots und Meta Muse an.

Alle Artikel