Rashomon verifica las acciones del agente de Claude Code para detectar fallos ocultos
La herramienta de código abierto Rashomon registra de forma independiente cada comando y acción de subagente en Claude Code, señalando discrepancias cuando el agente afirma haber tenido éxito a pesar de errores subyacentes.
Traducido automáticamente del original en inglés.
Una nueva utilidad de código abierto llamada Rashomon ofrece una capa de verificación independiente para Claude Code, el asistente de programación con IA. Lanzada en la versión alpha 1.1.0 el 5 de octubre de 2026, esta herramienta funciona en macOS y Linux para rastrear exactamente qué hace un agente de IA durante una sesión de codificación. Aborda la creciente preocupación entre los desarrolladores de que los agentes de IA puedan reportar con confianza un éxito incluso cuando tareas en segundo plano o subagentes han fallado.
Qué ha ocurrido
Rashomon actúa como un observador silencioso durante las sesiones de Claude Code, manteniendo un registro separado de cada llamada a herramientas, edición de archivos y ejecución de comandos. A diferencia de la interacción estándar, donde los desarrolladores dependen únicamente del resumen final del agente, Rashomon compara sus propios datos registrados con la declaración de cierre del agente. Si el agente afirma que todas las pruebas pasan pero Rashomon detecta un comando fallido o un código de error, señala la discrepancia inmediatamente.
La herramienta está diseñada para permanecer discreta durante la operación normal. Solo interrumpe el flujo de trabajo cuando detecta una posible inconsistencia entre la narrativa del agente y los eventos reales del sistema. Esto incluye el seguimiento de acciones realizadas por subagentes, que son instancias auxiliares generadas por la IA principal para manejar subtareas específicas. Estas actividades de los subagentes suelen ser invisibles en la transcripción principal de la conversación, creando puntos ciegos para los desarrolladores que asumen que el agente principal tiene visibilidad y control total.
Los desarrolladores pueden instalar Rashomon ya sea como un plugin nativo de Claude Code o como una utilidad independiente de línea de comandos. El proyecto enfatiza la privacidad y el procesamiento local, asegurando que ningún código, prompt o contenido de archivo se almacene o transmita externamente. Funciona puramente como un auditor local, ofreciendo una segunda opinión sobre el rendimiento del agente sin alterar su comportamiento ni bloquear sus acciones.
Cómo funciona
Rashomon opera conectándose al pipeline de ejecución de Claude Code. Al instalarse, registra oyentes (listeners) para llamadas a herramientas y ejecuciones de comandos. Por cada acción que realiza el agente, como ejecutar una suite de pruebas o editar un archivo, Rashomon registra el resultado, incluidos los códigos de salida y cualquier error generado. Monitorea específicamente una lista de cuarenta y tres palabras clave relacionadas con fallos, como "error", "failed" o "unable", en el resumen final del agente.
Si un comando falla pero el resumen del agente no contiene ninguna de estas palabras de fallo, Rashomon genera una alerta. Este mecanismo ayuda a detectar alucinaciones donde la IA podría interpretar erróneamente una ejecución de prueba fallida como un éxito o simplemente pasar por alto un error de un subagente. La herramienta también rastrea las actividades de los subagentes por separado, listando sus declaraciones y ejecuciones aunque no aparezcan en el historial principal del chat.
El sistema de informes es determinista y transparente. No adivina la intención ni analiza el significado semántico del código. En su lugar, presenta una comparación factual: el resumen citado del agente frente a los resultados técnicos registrados. Esto permite a los desarrolladores identificar rápidamente si existe una discrepancia e investigar los comandos específicos o subagentes involucrados sin tener que revisar manualmente extensos registros.
Detalles clave
- Soporte de plataforma: Actualmente solo admite macOS y Linux; Windows aún no es compatible en esta versión alpha.
- Métodos de instalación: Disponible como plugin de Claude Code a través del marketplace o como binario independiente instalado mediante curl o Go.
- Modelo de privacidad: No almacena prompts, respuestas ni contenidos de archivos; solo registra nombres de comandos, conteos de argumentos y nombres de host.
- Visibilidad de subagentes: Rastrea y reporta explícitamente las acciones tomadas por subagentes, que normalmente están ocultas en la transcripción principal de la conversación.
- Detección de fallos: Utiliza una lista fija de cuarenta y tres palabras clave de fallo para verificar si el resumen del agente reconoce algún error registrado.
- Limitaciones de red: No observa el tráfico de red en vivo en esta versión alpha, aunque puede integrarse con auditorías de sandbox externas como nono.
Por qué importa
Para los ingenieros de software que dependen de asistentes de programación con IA, la confianza es un componente crítico pero frágil del flujo de trabajo. A medida que los agentes se vuelven más autónomos, generando subagentes y ejecutando cadenas complejas de comandos, aumenta el riesgo de fallos silenciosos. Un agente podría refactorizar correctamente una función pero fallar al ejecutar la suite de pruebas asociada, lo que lleva a compilaciones rotas difíciles de rastrear hasta las acciones de la IA. Rashomon proporciona una red de seguridad necesaria al asegurar que la confianza del agente coincida con la realidad.
Esta herramienta también destaca la opacidad de los sistemas multi-agente. Cuando una IA delega tareas a subagentes, la interfaz principal a menudo oculta los detalles de esas acciones delegadas. Sin una verificación independiente, los desarrolladores podrían perderse errores críticos que ocurren en estas capas ocultas. Al exponer la actividad de los subagentes y contrastarla con el resumen del agente principal, Rashomon ayuda a mantener la responsabilidad y la transparencia en el desarrollo asistido por IA.
Además, el énfasis en el procesamiento local y la retención cero de datos aborda importantes preocupaciones de seguridad. Muchas organizaciones dudan en adoptar herramientas de IA debido al miedo a filtraciones de código o exposición de datos propietarios. El diseño de Rashomon, que evita almacenar contenido sensible y opera completamente offline, ofrece un modelo de cómo construir herramientas de verificación sin comprometer la seguridad o la privacidad.
Qué puedes hacer
- Instala Rashomon utilizando los comandos del marketplace de plugins de Claude Code o el instalador standalone de curl para macOS o Linux.
- Ejecuta una sesión de prueba rompiendo intencionalmente una prueba en tu proyecto y pidiendo a Claude Code que la arregle, luego revisa el informe de Rashomon para detectar discrepancias.
- Usa el comando
/rashomon:reportdentro de Claude Code orashomon reporten la terminal para ver registros detallados de las acciones del agente.



