JevShield nutzt typisierte Entscheidungen, um Prompt-Injection-Angriffe lokal zu blockieren
Ein neues Open-Source-Tool verwendet Ollama und Nimble, um Prompt-Injections anhand strukturierter Daten statt generativer Texte zu erkennen und hält die Sicherheitsprüfungen lokal.
Automatisch aus dem englischen Original übersetzt.
Der Entwickler Rajat Rao hat am 1. Oktober 2026 JevShield veröffentlicht, eine Open-Source-Sicherheitsschicht, die Large-Language-Model-Agenten vor Prompt-Injection-Angriffen schützen soll. Das Projekt läuft vollständig auf lokaler Infrastruktur und nutzt die Decision-Model-API von Ollama sowie das Nimble-Modell, um eingehende Inhalte zu bewerten, bevor sie die primäre Anwendungslogik erreichen.
Was passiert ist
JevShield stellt eine Firewall speziell für LLM-Agenten vor, die nicht vertrauenswürdige externe Inhalte verarbeiten müssen. Traditionelle Sicherheitsansätze bitten oft ein generatives Modell um eine textbasierte Einschätzung, beispielsweise ob ein Prompt böswillig ist oder nicht (Ja/Nein-Antwort). Diese Methode erfordert, dass die Anwendung Freitext parst, was fehleranfällig und fragil sein kann. JevShield ersetzt dieses Muster durch eine strukturierte Entscheidungsengine, die typisierte Daten anstelle von natürlicher Sprache zurückgibt.
Das System ist darauf ausgelegt, fünf spezifische Bedrohungskategorien zu erkennen: direkte Prompt-Injection, indirekte Prompt-Injection, Jailbreaks, Versuche der Datenexfiltration und bösartige Tool-Manipulation. Indem es Benutzereingaben und abgerufene Dokumente abfängt, bevor sie den Agenten beeinflussen, zielt das Tool darauf ab, das Prinzip durchzusetzen, dass nicht vertrauenswürdiger Text als Daten und nicht als ausführbare Anweisungen behandelt werden sollte. Das Repository enthält eine Benchmark-Suite, ein Streamlit-Dashboard zur Visualisierung und eine FastAPI-Schnittstelle für die Integration in bestehende Python-Anwendungen.
Wie es funktioniert
Der Kernmechanismus basiert auf der Jev-artigen Decision-API von Ollama, insbesondere dem Endpoint /v1/systemone, anstatt Standard-Chat- oder Generierungs-Endpoints. Wenn Inhalte eintreffen, sendet JevShield diese an das Nimble-Modell, das mehrere Sicherheitsdimensionen gleichzeitig bewertet. Anstatt einen Satz zu generieren, gibt das Modell strukturierte Objekte zurück, die Choices, Scores und Noul-Werte enthalten. Ein Score repräsentiert einen erwarteten Index innerhalb eines Bereichs, während ein Noul-Wert eine direkte Wahrscheinlichkeitsschätzung zwischen null und eins liefert.
Diese strukturierten Ausgaben fließen in eine deterministische Python-Policy-Engine ein. Die Engine normalisiert die Risiken und wendet konfigurierbare Schwellenwerte an, um die endgültige Entscheidung zu treffen. Liegt das maximale normalisierte Risiko unter 0,50, wird der Inhalt zugelassen. Fällt er zwischen 0,50 und 0,85, wird er zur Überprüfung markiert. Jeder Risikoscore bei oder über 0,85 löst eine Blockade aus. Diese Trennung stellt sicher, dass das probabilistische Modell Beweise liefert, während der deterministische Code die Sicherheitsrichtlinie durchsetzt. Das System verfolgt auch Taints, um sicherzustellen, dass als nicht vertrauenswürdig identifizierte Inhalte von privilegierten Operationen isoliert bleiben.
Wichtige Details
- Nutzt den
/v1/systemone-Endpoint von Ollama mit dem Nimble-Modell für lokale Inferenz. - Erkennt direkte Injection, indirekte Injection, Jailbreaks, Exfiltration und Tool-Manipulation.
- Gibt typisierte Entscheidungen einschließlich Choice, Score und Noul anstelle von generativem Text zurück.
- Wendet eine deterministische Python-Policy mit Standard-Schwellenwerten von 0,50 für Überprüfung und 0,85 für Blockade an.
- Enthält ein Fail-Closed-Verhalten, bei dem Fehler des Evaluators standardmäßig zu blockierten Anfragen führen.
- Bietet ein Streamlit-Dashboard und FastAPI-REST-Endpoints für Integration und Monitoring.
Warum es wichtig ist
Für Ingenieure, die KI-Agenten entwickeln, die mit externen Datenquellen wie E-Mails, Websites oder Datenbanken interagieren, bleibt Prompt-Injection eine kritische Schwachstelle. Indirekte Injections, bei denen böswillige Anweisungen in abgerufenen Dokumenten versteckt sind, sind besonders schwer zu entschärfen, da der Agent den Dokumentinhalt möglicherweise als Teil seines Anweisungssatzes interpretiert. JevShield adressiert dies, indem es eine Sicherheitsgrenze schafft, die Inhaltsprovenienz und Risiko bewertet, bevor der Hauptagent den Inhalt verarbeitet. Dies ermöglicht Entwicklern, externe Eingaben als potenziell feindselige Daten und nicht als vertrauenswürdige Befehle zu behandeln.
Die Umstellung von generativen Einschätzungen auf typisierte Entscheidungen verbessert zudem die Zuverlässigkeit. Das Parsen von Natural-Language-Antworten eines Sicherheitsmodells führt zu Mehrdeutigkeiten und potenziellen Fehlerpunkten. Durch die Verwendung strukturierter Datentypen kann die Anwendung Sicherheitsbewertungen mit derselben Präzision wie andere Backend-Logiken handhaben. Darüber hinaus stellt die lokale Ausführung dieser Prüfungen über Ollama sicher, dass sensible Daten die Infrastruktur nicht verlassen, was Datenschutzbedenken im Zusammenhang mit cloudbasierten Sicherheits-APIs adressiert. Diese Architektur unterstützt eine Defense-in-Depth-Strategie und ergänzt andere Kontrollen wie Least-Privilege-Tool-Zugriffe.
Fazit
JevShield bietet einen robusten Ansatz zur Bekämpfung von Prompt-Injections durch die Kombination aus lokalen Modellen und strukturierten Entscheidungsprozessen. Für Teams, die Wert auf Datenschutz und deterministisches Verhalten legen, stellt es eine wertvolle Ergänzung im Sicherheitsstack dar.


