Sicherheit & Datenschutz

CounterSteer schützt LLM-Agenten vor indirekter Prompt-Injection

Eine neue Verteidigungsmethode zur Inferenzzeit namens CounterSteer unterdrückt indirekte Prompt-Injection, indem sie einen spezifischen Aktivierungsvektor von Tool-Ergebnissen subtrahiert. Dies reduziert die Erfolgsraten von Angriffen erheblich, ohne

Illustration of activation steering removing a malicious vector from a model's internal state.
Für diesen Artikel generierte Illustration

Automatisch aus dem englischen Original übersetzt.

Forscher haben CounterSteer vorgestellt, einen neuartigen Verteidigungsmechanismus zum Schutz von Large-Language-Model-(LLM)-Agenten vor indirekten Prompt-Injection-Angriffen. Die im Oktober 2026 auf arXiv veröffentlichte Methode arbeitet zur Inferenzzeit und modifiziert die internen Aktivierungen des Modells, anstatt sich auf Eingabefilterung oder Ausgabeüberwachung zu verlassen. Das Verfahren zielt auf die spezifische Schwachstelle ab, bei der nicht vertrauenswürdiger abgerufener Text vom Agenten fälschlicherweise als ausführbare Anweisung behandelt wird.

Was passiert ist

Indirekte Prompt-Injection bleibt ein kritisches Sicherheitsproblem für KI-Agenten, die externe Daten abrufen und verarbeiten. In diesen Szenarien bettet ein Angreifer bösartige Anweisungen in scheinbar harmlose Inhalte ein, wie etwa eine Webseite oder ein Dokument. Wenn der Agent diese Inhalte abruft, befolgt er möglicherweise die eingebetteten Befehle statt der ursprünglichen Absicht des Nutzers, was zu Datenlecks oder unbefugten Aktionen führt. Herkömmliche Abwehrmaßnahmen haben oft Schwierigkeiten, legitime Inhalte von versteckten Anweisungen zu unterscheiden, ohne die allgemeine Leistungsfähigkeit des Modells zu beeinträchtigen.

CounterSteer begegnet diesem Problem, indem es die neuronalen Pfade identifiziert und unterdrückt, die mit dem Befolgen eingebetteter Anweisungen verbunden sind. Die Forscher entwickelten ein Fünf-Schritte-Rezept, um eine Richtung im Residual-Stream aus gepaarten Episoden abzuleiten. Diese Episoden unterscheiden sich nur darin, ob eine eingebettete Anweisung befolgt oder ignoriert wird. Durch die Isolierung dieses spezifischen Richtungsvektors im Aktivierungsraum des Modells kann die Verteidigung das Verhalten präzise adressieren. Die Richtung wird nur dann beibehalten, wenn sie vordefinierte kausale und Fähigkeits-Gates passiert, um sicherzustellen, dass sie keine anderen Modellfunktionen stört.

Die Evaluierung umfasste fünf Open-Weights-Modelle mit Parameterzahlen zwischen 8 Milliarden und 106 Milliarden, die fünf verschiedenen Anbieterlinien angehören. Die Ergebnisse zeigten eine dramatische Reduktion der Angriffserfolge. Nicht verteidigte Modelle wiesen Angriffserfolgsraten zwischen 0,21 und 1,00 auf, die mit aktivem CounterSteer auf 0,00–0,17 fielen. Ebenso sank die Kompromittierungsrate im AgentDojo-Benchmark von 0,10–0,49 auf 0,006–0,079. Entscheidend war, dass dieser Sicherheitsgewinn mit minimalen Auswirkungen auf die nützliche Funktionalität einherging; die typografie-normalisierte Leistung blieb bei 93–100 % erhalten.

Wie es funktioniert

CounterSteer operiert vollständig zur Inferenzzeit und erfordert kein Fine-Tuning, keine Hilfsmodelle und keine zusätzlichen Tokens. Es setzt White-Box-Serving voraus, d. h., der Verteidiger hat Zugriff auf die internen Zustände des Modells, und benötigt Kenntnis der Span-Grenzen der Tool-Ergebnisse. Während der Prefill-Phase, wenn das Modell den abgerufenen Kontext verarbeitet, subtrahiert das System die identifizierte Residual-Stream-Richtung von jedem Token, das mit Tool-Ergebnissen assoziiert ist. Diese Subtraktion neutralisiert effektiv die Tendenz zur Übernahme durch Anweisungen, bevor das Modell eine Antwort generiert.

Da die Bearbeitung immer aktiv ist, gibt es keine Erkennungsentscheidung, die ein Angreifer umgehen könnte. Im Gegensatz zu Klassifikatoren, die durch Adversarial Examples getäuscht werden könnten, verändert diese Methode direkt den Berechnungsgraphen. Die Forscher merkten an, dass die Verteidigung zwar robust gegen viele Angriffsvektoren ist, aber nicht alle Probleme löst. Parameter-Manipulation, bei der Angreifer Argumente in ansonsten legitimen Aufrufen wählen, wird nur teilweise widerstanden. In diesen Fällen wird die Entscheidung erst bei der Emission der Argumente linear lesbar, nicht jedoch in früheren Stadien, was darauf hindeutet, dass Kontrollen zur Herkunft der Argumente weiterhin notwendig sind.

Wichtige Details

  • Die Verteidigung senkt die Erfolgsraten bei gehaltenen Angriffen über fünf Open-Weights-Modelle hinweg von 0,21–1,00 auf 0,00–0,17.
  • Die Kompromittierungsraten im AgentDojo sinken erheblich von 0,10–0,49 (unverteidigt) auf 0,006–0,079 (verteidigt).
  • Die nützliche Funktionalität bleibt hoch bei 93–100 % typografie-normalisiert, wodurch der Verlust von 22–89 %, der bei anderen Verteidigungen beobachtet wurde, vermieden wird.
  • Kein Fine-Tuning oder Hilfsmodelle erforderlich; die Methode nutzt ausschließlich White-Box-Serving und Span-Grenzen der Tool-Ergebnisse.
  • Die Erfolgsrate eines adaptiven Angreifers auf Benchmark-Ebene wird bei tiefgreifend evaluierten Modellen auf etwa ein Viertel seiner unverteidigten Leistung reduziert.
  • White-Box-Gradienten-Angriffe kompromittieren höchstens 2 von 52 Episoden, und keiner der 2.052 wiederholten menschlichen Red-Team-Angriffe ist erfolgreich.

Warum das wichtig ist

Für Ingenieure, die agentische Systeme entwickeln, bietet CounterSteer einen praktischen Weg, Retrieval-Augmented-Generation-(RAG)-Pipelines zu sichern, ohne Leistungseinbußen hinzunehmen. Viele bestehende Verteidigungen erzwingen einen Kompromiss zwischen Sicherheit und Nutzbarkeit, blockieren oft legitime Anfragen oder erfordern teures Nachtraining. Indem CounterSteer zur Inferenzzeit mit vernachlässigbarem Overhead für benign Tasks operiert, ermöglicht es Entwicklern, hohe Reaktionsfähigkeit beizubehalten, während sie eine der hartnäckigsten Bedrohungen in der KI-Sicherheit mildern. Dies ist besonders wertvoll für Anwendungen, die sensible Daten verarbeiten, wo False Positives in Sicherheitsfiltern Workflows stören können.

Die Forschung hebt jedoch auch die Grenzen aktueller Verteidigungsstrategien hervor. Während CounterSteer die Übernahme durch Anweisungen weitgehend neutralisiert, verhindert es Angriffe zur Parameter-Manipulation nicht vollständig. Diese Unterscheidung ist entscheidend für Systemarchitekten, die mehrere Sicherheitskontrollen schichten müssen. Sich allein auf Activation Steering zu verlassen, kann Lücken in der Validierung der Argumente hinterlassen. Die Erkenntnisse deuten darauf hin, dass robuste Agentensicherheit eine Kombination aus interner Aktivierungsverwaltung und externen Herkunftskontrollen erfordert und die Branche zu umfassenderen, mehrschichtigen Verteidigungsarchitekturen drängt.

Was Sie tun können

  • Prüfen Sie, ob Ihre LLM-Bereitstellung White-Box-Zugriff auf interne Residual Streams unterstützt, um eine mögliche Integration von Activation-Steering-Techniken zu ermöglichen.
  • Implementieren Sie striktes Tracking der Span-Grenzen für potenzielle Integration von Activation-Steering-Techniken.

Tools aus dem Bytechap-Shop

Weiterlesen

Alle Artikel