Rashomon verifiziert Claude Code-Agentenaktionen, um versteckte Fehler zu erkennen
Das Open-Source-Tool Rashomon protokolliert unabhängig jede Befehls- und Subagent-Aktion in Claude Code und markiert Abweichungen, wenn der Agent Erfolg meldet, obwohl zugrunde liegende Fehler vorliegen.
Automatisch aus dem englischen Original übersetzt.
Ein neues Open-Source-Dienstprogramm namens Rashomon bietet eine unabhängige Verifikationsebene für Claude Code, den KI-Coding-Assistenten. Veröffentlicht am 5. Oktober 2026 in der Alpha-Version 1.1.0, läuft dieses Tool auf macOS und Linux, um genau nachzuverfolgen, was ein KI-Agent während einer Coding-Sitzung tut. Es adressiert die wachsende Sorge unter Entwicklern, dass KI-Agenten selbstbewusst Erfolg melden könnten, auch wenn Hintergrund-Tasks oder Subagenten fehlgeschlagen sind.
Was passiert ist
Rashomon fungiert als stiller Beobachter während Claude-Code-Sitzungen und führt ein separates Protokoll über jeden Tool-Aufruf, Datei-Bearbeitung und Befehlsausführung. Im Gegensatz zur Standardinteraktion, bei der sich Entwickler ausschließlich auf die endgültige Zusammenfassung des Agenten verlassen, vergleicht Rashomon seine eigenen aufgezeichneten Daten mit der Abschlussaussage des Agenten. Wenn der Agent behauptet, alle Tests seien bestanden, aber Rashomon einen fehlgeschlagenen Befehl oder Fehlercode erkennt, wird diese Diskrepanz sofort markiert.
Das Tool ist so konzipiert, dass es im normalen Betrieb unauffällig bleibt. Es unterbricht den Workflow nur dann, wenn es eine potenzielle Unstimmigkeit zwischen der Erzählung des Agenten und den tatsächlichen Systemereignissen feststellt. Dazu gehört das Nachverfolgen von Aktionen, die von Subagenten ausgeführt werden – Hilfsinstanzen, die vom Haupt-KI-Agenten gestartet werden, um spezifische Teilaufgaben zu erledigen. Diese Subagent-Aktivitäten sind oft im Haupt-Gesprächstranskript unsichtbar, was Blindstellen für Entwickler schafft, die davon ausgehen, dass der primäre Agent volle Sichtbarkeit und Kontrolle hat.
Entwickler können Rashomon entweder als natives Claude-Code-Plugin oder als eigenständiges Kommandozeilen-Dienstprogramm installieren. Das Projekt legt Wert auf Privatsphäre und lokale Verarbeitung und stellt sicher, dass kein Code, keine Prompts und keine Datei-Inhalte extern gespeichert oder übertragen werden. Es funktioniert rein als lokaler Auditor, der eine zweite Meinung zur Leistung des Agenten liefert, ohne das Verhalten des Agenten zu verändern oder seine Aktionen zu blockieren.
Wie es funktioniert
Rashomon arbeitet, indem es sich in die Ausführungspipeline von Claude Code einklinkt. Bei der Installation registriert es Listener für Tool-Aufrufe und Befehlsausführungen. Für jede Aktion, die der Agent ausführt, wie z. B. das Ausführen einer Test-Suite oder das Bearbeiten einer Datei, zeichnet Rashomon das Ergebnis auf, einschließlich Exit-Codes und generierter Fehler. Es überwacht speziell eine Liste von dreiundvierzig fehlerbezogenen Schlüsselwörtern wie "error", "failed" oder "unable" in der endgültigen Zusammenfassung des Agenten.
Wenn ein Befehl fehlschlägt, aber die Zusammenfassung des Agenten keines dieser Fehlerwörter enthält, erzeugt Rashomon eine Warnung. Dieser Mechanismus hilft dabei, Halluzinationen zu erfassen, bei denen die KI einen fehlgeschlagenen Testlauf fälschlicherweise als Erfolg interpretiert oder einfach einen Fehler eines Subagenten übersieht. Das Tool verfolgt auch Subagent-Aktivitäten separat und listet deren Deklarationen und Ausführungen auf, selbst wenn sie nicht im Haupt-Chat-Verlauf erscheinen.
Das Berichtssystem ist deterministisch und transparent. Es rät nicht nach Absichten oder analysiert die semantische Bedeutung des Codes. Stattdessen präsentiert es einen faktischen Vergleich: die zitierte Zusammenfassung des Agenten versus die aufgezeichneten technischen Ergebnisse. Dies ermöglicht es Entwicklern, schnell zu identifizieren, ob eine Diskrepanz vorliegt, und die spezifischen Befehle oder Subagenten zu untersuchen, ohne manuell umfangreiche Logs durchsuchen zu müssen.
Wichtige Details
- Plattformunterstützung: Unterstützt derzeit nur macOS und Linux; Windows wird in dieser Alpha-Version noch nicht unterstützt.
- Installationsmethoden: Verfügbar als Claude-Code-Plugin über den Marketplace oder als eigenständige Binary, installiert via curl oder Go.
- Datenschutzmodell: Speichert keine Prompts, Antworten oder Datei-Inhalte; zeichnet nur Befehlsnamen, Argumentanzahlen und Hostnamen auf.
- Subagent-Sichtbarkeit: Verfolgt und meldet explizit Aktionen von Subagenten, die typischerweise im Haupt-Gesprächstranskript verborgen sind.
- Fehlererkennung: Nutzt eine feste Liste von dreiundvierzig Fehler-Schlüsselwörtern, um zu prüfen, ob die Zusammenfassung des Agenten aufgezeichnete Fehler anerkennt.
- Netzwerkbeschränkungen: Beobachtet in dieser Alpha-Version keinen Live-Netzwerkverkehr, kann jedoch mit externen Sandbox-Audits wie nono integriert werden.
Warum es wichtig ist
Für Software-Ingenieure, die sich auf KI-Coding-Assistenten verlassen, ist Vertrauen eine kritische, aber fragile Komponente des Workflows. Da Agenten autonomer werden, Subagenten starten und komplexe Befehlsketten ausführen, steigt das Risiko von stillen Fehlern. Ein Agent könnte eine Funktion erfolgreich refaktorisieren, aber versagen, die zugehörige Test-Suite korrekt auszuführen, was zu gebrochenen Builds führt, die schwer auf die Aktionen der KI zurückzuführen sind. Rashomon bietet ein notwendiges Sicherheitsnetz, indem es sicherstellt, dass das Selbstvertrauen des Agenten der Realität entspricht.
Dieses Tool hebt auch die Intransparenz von Multi-Agenten-Systemen hervor. Wenn eine KI Aufgaben an Subagenten delegiert, verbirgt die primäre Schnittstelle oft die Details dieser delegierten Aktionen. Ohne unabhängige Verifikation könnten Entwickler kritische Fehler übersehen, die in diesen versteckten Ebenen auftreten. Indem Rashomon Subagent-Aktivitäten offenlegt und sie mit der Zusammenfassung des Hauptagenten abgleicht, trägt es dazu bei, Rechenschaftspflicht und Transparenz in der KI-unterstützten Entwicklung zu wahren.
Darüber hinaus adressiert die Betonung auf lokale Verarbeitung und null Datenspeicherung erhebliche Sicherheitsbedenken. Viele Organisationen zögern, KI-Tools einzuführen, aus Angst vor Code-Leaks oder der Offenlegung proprietärer Daten. Das Design von Rashomon, das sensible Inhalte vermeidet und vollständig offline operiert, bietet ein Modell dafür, wie Verifikations-Tools gebaut werden können, ohne Sicherheit oder Privatsphäre zu gefährden.
Was Sie tun können
- Installieren Sie Rashomon über die Claude-Code-Plugin-Marketplace-Befehle oder das eigenständige curl-Installationsprogramm für macOS oder Linux.
- Führen Sie eine Test-Sitzung durch, indem Sie absichtlich einen Test in Ihrem Projekt brechen und Claude Code bitten, ihn zu beheben, und prüfen Sie anschließend den Rashomon-Bericht auf Diskrepanzen.
- Verwenden Sie den Befehl
/rashomon:reportinnerhalb von Claude Code oderrashomon reportin der Kommandozeile. - Nutzen Sie die
/rashomon:report-Kommandofunktion innerhalb von Claude Code oder führen Sierashomon reportin der Shell aus.



