Agents IA

Rashomon vérifie les actions des agents Claude Code pour détecter les échecs cachés

L'outil open source Rashomon enregistre indépendamment chaque commande et action de sous-agent dans Claude Code, signalant les divergences lorsque l'agent revendique un succès malgré des erreurs sous-jacentes.

A magnifying glass reveals hidden errors beneath a success message on a code screen.
Illustration générée pour cet article

Traduit automatiquement depuis l'original anglais.

Un nouvel utilitaire open source nommé Rashomon offre une couche de vérification indépendante pour Claude Code, l'assistant de codage IA. Lancé en version alpha 1.1.0 le 5 octobre 2026, cet outil fonctionne sur macOS et Linux pour suivre précisément ce que fait un agent IA lors d'une session de codage. Il répond à la préoccupation croissante des développeurs selon laquelle les agents IA peuvent affirmer avec confiance avoir réussi même si des tâches en arrière-plan ou des sous-agents ont échoué.

Ce qui s'est passé

Rashomon agit comme un observateur silencieux pendant les sessions Claude Code, maintenant un journal séparé de chaque appel d'outil, modification de fichier et exécution de commande. Contrairement à l'interaction standard où les développeurs se fient uniquement au résumé final de l'agent, Rashomon compare ses propres données enregistrées avec la déclaration de clôture de l'agent. Si l'agent affirme que tous les tests réussissent mais que Rashomon détecte une commande échouée ou un code d'erreur, il signale immédiatement la divergence.

L'outil est conçu pour rester discret lors du fonctionnement normal. Il n'interrompt le flux de travail que lorsqu'il détecte une incohérence potentielle entre le récit de l'agent et les événements système réels. Cela inclut le suivi des actions effectuées par les sous-agents, qui sont des instances auxiliaires lancées par l'IA principale pour gérer des sous-tâches spécifiques. Ces activités de sous-agents sont souvent invisibles dans la transcription de la conversation principale, créant des angles morts pour les développeurs qui supposent que l'agent principal a une visibilité et un contrôle complets.

Les développeurs peuvent installer Rashomon soit en tant que plugin natif Claude Code, soit en tant qu'utilitaire en ligne de commande autonome. Le projet met l'accent sur la confidentialité et le traitement local, garantissant qu'aucun code, prompt ou contenu de fichier n'est stocké ou transmis en externe. Il fonctionne purement comme un auditeur local, offrant un second avis sur la performance de l'agent sans altérer son comportement ni bloquer ses actions.

Comment cela fonctionne

Rashomon opère en s'accrochant au pipeline d'exécution de Claude Code. Une fois installé, il enregistre des écouteurs pour les appels d'outils et les exécutions de commandes. Pour chaque action entreprise par l'agent, telle que l'exécution d'une suite de tests ou la modification d'un fichier, Rashomon enregistre le résultat, y compris les codes de sortie et les erreurs générées. Il surveille spécifiquement une liste de quarante-trois mots-clés liés aux échecs, tels que "error", "failed" ou "unable", dans le résumé final de l'agent.

Si une commande échoue mais que le résumé de l'agent ne contient aucun de ces mots d'échec, Rashomon génère une alerte. Ce mécanisme aide à détecter les hallucinations où l'IA pourrait interpréter à tort une exécution de test échouée comme un succès ou simplement négliger une erreur de sous-agent. L'outil suit également les activités des sous-agents séparément, énumérant leurs déclarations et exécutions même si elles n'apparaissent pas dans l'historique de chat principal.

Le système de reporting est déterministe et transparent. Il ne devine pas l'intention ni n'analyse la signification sémantique du code. Au lieu de cela, il présente une comparaison factuelle : le résumé cité de l'agent contre les résultats techniques enregistrés. Cela permet aux développeurs d'identifier rapidement si une divergence existe et d'enquêter sur les commandes ou sous-agents spécifiques impliqués sans fouiller manuellement dans des journaux étendus.

Détails clés

  • Support de plateforme : Actuellement compatible uniquement avec macOS et Linux ; Windows n'est pas encore pris en charge dans cette version alpha.
  • Méthodes d'installation : Disponible en tant que plugin Claude Code via le marketplace ou en binaire autonome installé via curl ou Go.
  • Modèle de confidentialité : Ne stocke aucun prompt, réponse ou contenu de fichier ; enregistre uniquement les noms de commandes, le nombre d'arguments et les noms d'hôtes.
  • Visibilité des sous-agents : Suit et signale explicitement les actions entreprises par les sous-agents, qui sont généralement masquées dans la transcription de la conversation principale.
  • Détection des échecs : Utilise une liste fixe de quarante-trois mots-clés d'échec pour vérifier si le résumé de l'agent reconnaît les erreurs enregistrées.
  • Limitations réseau : N'observe pas le trafic réseau en direct dans cette version alpha, bien qu'il puisse s'intégrer à des audits de sandbox externes comme nono.

Pourquoi c'est important

Pour les ingénieurs logiciels dépendant des assistants de codage IA, la confiance est un composant critique mais fragile du flux de travail. À mesure que les agents deviennent plus autonomes, lançant des sous-agents et exécutant des chaînes complexes de commandes, le risque d'échecs silencieux augmente. Un agent peut réussir à refactoriser une fonction mais échouer à exécuter correctement la suite de tests associée, entraînant des builds cassés difficiles à tracer jusqu'aux actions de l'IA. Rashomon fournit un filet de sécurité nécessaire en garantissant que la confiance de l'agent correspond à la réalité.

Cet outil met également en lumière l'opacité des systèmes multi-agents. Lorsqu'une IA délègue des tâches à des sous-agents, l'interface principale cache souvent les détails de ces actions déléguées. Sans vérification indépendante, les développeurs peuvent manquer des erreurs critiques se produisant dans ces couches cachées. En exposant l'activité des sous-agents et en la croisant avec le résumé de l'agent principal, Rashomon aide à maintenir la responsabilité et la transparence dans le développement assisté par IA.

De plus, l'accent mis sur le traitement local et la rétention zéro de données répond à des préoccupations de sécurité significatives. De nombreuses organisations hésitent à adopter des outils IA par crainte de fuite de code ou d'exposition de données propriétaires. La conception de Rashomon, qui évite de stocker du contenu sensible et fonctionne entièrement hors ligne, offre un modèle pour construire des outils de vérification sans compromettre la sécurité ou la vie privée.

Ce que vous pouvez faire

  • Installez Rashomon en utilisant les commandes du marketplace de plugins Claude Code ou l'installateur curl autonome pour macOS ou Linux.
  • Lancez une session de test en cassant intentionnellement un test dans votre projet et en demandant à Claude Code de le corriger, puis consultez le rapport Rashomon pour les divergences.
  • Utilisez la commande /rashomon:report dans Claude Code ou rashomon report dans le terminal pour afficher les journaux détaillés des actions de l'agent.

Outils de la Boutique Bytechap

Continuer la lecture

Tous les articles