Sicherheit & Datenschutz

ZeroLeaks veröffentlicht Shield Small zur lokalen Erkennung von Prompt-Injection

ZeroLeaks hat Shield Small veröffentlicht, einen leichten Klassifizierer mit 118 Mio. Parametern, der Prompt-Injections und Jailbreaks lokal auf der CPU erkennt.

Automatisch aus dem englischen Original übersetzt.

ZeroLeaks hat Shield Small veröffentlicht, einen kompakten Klassifizierer, der entwickelt wurde, um Prompt-Injections und Jailbreak-Versuche in KI-Anwendungen zu erkennen. Das am 2. Oktober 2026 veröffentlichte Modell läuft vollständig offline auf einer Standard-CPU und bietet Entwicklern eine Möglichkeit, nicht vertrauenswürdigen Text mit geringer Latenz zu prüfen, bevor er an einen Agenten weitergegeben wird.

Was ist passiert

Shield Small ist ein Modell mit 118 Millionen Parametern, das auf der Architektur intfloat/multilingual-e5-small basiert. Es verwendet int8 ONNX-Gewichte mit einer Gesamtgröße von etwa 118 MB, was es klein genug macht, um es zusammen mit Anwendungscode bereitzustellen, ohne dass spezielle GPU-Hardware erforderlich ist. Das Modell fungiert als binärer Klassifizierer, der Eingabetexte entweder als harmlos oder als Injektionsversuch kennzeichnet, und liefert für jede Vorhersage einen Konfidenzwert.

Die Veröffentlichung schließt eine kritische Lücke in agentischen Workflows, in denen Agenten abgerufene Dokumente, Tool-Ergebnisse oder Benutzernachrichten verarbeiten, die versteckte Anweisungen enthalten können. Durch die lokale Ausführung ermöglicht der Klassifizierer Anwendungen, diese Eingaben in Echtzeit zu überprüfen. Das System gibt sowohl ein binäres Urteil als auch einen Injektions-Score zurück und überlässt die endgültige Entscheidung, Inhalte zu blockieren oder zu überprüfen, dem Anwendungsentwickler.

Diese Version, bezeichnet als S15e, stellt einen fokussierten Versuch dar, eine nicht-kommerzielle Baseline für die Sicherheitsprüfung bereitzustellen. Während der Beispielcode unter der MIT-Lizenz steht, werden die Modellgewichte selbst unter CC BY-NC 4.0 veröffentlicht, was bedeutet, dass für kommerzielle Nutzung eine separate Lizenz von ZeroLeaks erforderlich ist. Diese Unterscheidung hebt den dualen Charakter der Veröffentlichung hervor: zugänglich für Forschung und persönliche Projekte, aber kontrolliert für den Unternehmenseinsatz.

Wie es funktioniert

Das Modell arbeitet als 12-schichtiger BERT-Encoder mit einem binären Klassifikationskopf. Es verarbeitet Text in Fenstern von 256 Tokens und nutzt eine Schrittweite (Stride) von 192 Tokens, um sich über längere Eingaben zu bewegen. Für eine gegebene Eingabe scannt es bis zu 32 Fenster und gibt den höchsten gefundenen Injektions-Score zurück. Dieser Sliding-Window-Ansatz stellt sicher, dass lokalisierte Angriffe innerhalb größerer Dokumente nicht durch globale Mittelwerte übersehen werden.

Bei Verwendung des bereitgestellten Python-Beispiels tokenisiert das System die vollständige Eingabe. Wenn der Text 6.206 Tokens überschreitet, prüft der Klassifizierer die ersten 28 Fenster und die letzten vier und überspringt den mittleren Abschnitt. In solchen Fällen enthält das Ergebnis einen Flag coverage.truncated: true. Entwickler müssen ein nicht gekennzeichnetes Ergebnis bei abgeschnittenem Text als unbestimmt und nicht als sicher betrachten, da der weggelassene mittlere Teil nicht analysiert wurde.

Die Inferenz-Pipeline ist unkompliziert. Nach dem Herunterladen des Modells über Hugging Face Hub können Entwickler die Klasse ShieldSmall initialisieren und Strings zur Klassifizierung übergeben. Die Ausgabe umfasst einen booleschen Status flagged und einen numerischen score. Der Standardschwellenwert für das Markieren liegt bei 0,5, aber die Dokumentation empfiehlt, diesen Wert basierend auf dem spezifischen Anwendungs-Traffic anzupassen, um Sensitivität und False Positives auszubalancieren.

Wichtige Details

  • Modellgröße: 118 Millionen Parameter mit 118 MB int8 ONNX-Gewichten.
  • Architektur: 12-schichtiger BERT-Encoder, abgeleitet von intfloat/multilingual-e5-small.
  • Leistung: Berichtet 84,3 % durchschnittliche kategorienausgeglichene Genauigkeit und 71,8 % Attack Recall in Kombination mit Shield Rules v2.
  • Eingabeverarbeitung: Verarbeitet 256-Token-Fenster mit einer 192-Token-Schrittweite; kürzt Eingaben über 6.206 Tokens.
  • Lizenz: Gewichte sind CC BY-NC 4.0 (nicht-kommerziell); Beispielcode ist MIT-lizenziert.
  • Bereitstellung: Läuft offline auf der CPU unter Python 3.11 oder 3.12.

Warum es wichtig ist

Für Ingenieure, die agentische Systeme entwickeln, bleibt Prompt Injection eine persistente Bedrohung, die herkömmliche Firewalls nicht adressieren können. Diese Angriffe betten bösartige Anweisungen in scheinbar harmlose Daten ein, wie z. B. eine abgerufene Webseite oder ein Kundensupport-Ticket. Shield Small bietet eine dedizierte Verteidigungsebene zwischen Datenaufnahme und Agentenverarbeitung, die es Teams ermöglicht, gefährliche Eingaben herauszufiltern, bevor sie das Modellverhalten beeinflussen.

Die Fähigkeit, diesen Klassifizierer lokal auf einer CPU auszuführen, ist für Kosten und Latenz signifikant. Viele bestehende Sicherheitslösungen erfordern API-Aufrufe an externe Dienste, was Abhängigkeitsrisiken und potenzielle Datenschutzbedenken einführt. Indem der Prüfungsprozess intern und offline gehalten wird, können Organisationen strengere Kontrolle über ihren Datenfluss beibehalten und gleichzeitig minimalen Rechenaufwand ihrer Infrastruktur hinzufügen.

Allerdings ist das Tool kein Allheilmittel. Die berichtete False-Positive-Rate von 7,2 % zeigt, dass legitime Sicherheitsdiskussionen oder komplexe Abfragen gelegentlich markiert werden könnten. Darüber hinaus variiert die Leistung des Modells je nach Sprache, da der Großteil der Trainingsdaten englischsprachig ist. Entwickler müssen diesen Klassifizierer als Teil einer breiteren Sicherheitsstrategie integrieren, die Zugangssteuerungen und Tool-Richtlinien einschließt, anstatt sich allein darauf als Verteidigungsmechanismus zu verlassen.

Was Sie tun können

  • Laden Sie die S15e-Gewichte von Hugging Face herunter und testen Sie den Klassifizierer gegen Ihren eigenen Datensatz von Benutzereingaben.
  • Passen Sie den Entscheidungsschwellenwert über oder unter 0,5 an, basierend auf Ihrer Toleranz gegenüber False Positives versus verpassten Angriffen.
  • Implementieren Sie Logik zur Behandlung abgeschnittener Eingaben, indem Sie Texte ablehnen oder manuell überprüfen, die 6.206 Tokens überschreiten.
  • Extrahieren Sie Klartext aus HTML oder strukturierten Dokumenten, bevor Sie sie an den Klassifizierer übergeben, um genaue Scoring-Ergebnisse zu gewährleisten.
  • Bewerten Sie die mehrsprachige Leistung des Modells, wenn Ihre Anwendung nicht-englische Sprachen unterstützt, da die Genauigkeit variieren kann.
  • Kontaktieren Sie ZeroLeaks für eine kommerzielle Lizenz, wenn Sie planen, Shield Small in einer produktiven Geschäftsumgebung einzusetzen.

Tools aus dem Bytechap-Shop

Weiterlesen

Alle Artikel