Agentes de IA

Depuración de agentes de IA con NVIDIA NeMo Relay y OpenTelemetry

NVIDIA NeMo Relay añade observabilidad a Hermes Agent, capturando trazas de ejecución detalladas para la depuración y la evaluación del rendimiento.

Traducido automáticamente del original en inglés.

NVIDIA ha publicado un tutorial técnico que demuestra cómo rastrear y depurar el comportamiento de los agentes de IA utilizando NeMo Relay. La guía se centra en el framework Hermes Agent, mostrando a los desarrolladores cómo capturar eventos estructurados del ciclo de vida y visualizarlos en herramientas como Arize Phoenix. Publicado a finales de septiembre de 2026, este recurso tiene como objetivo resolver el problema de la "caja negra" inherente a los sistemas autónomos complejos.

Qué ocurrió

El blog técnico de NVIDIA publicó una guía práctica para implementar la observabilidad en agentes de IA. El tema central es NeMo Relay, una capa que registra eventos ordenados y trayectorias durante la ejecución del agente. El tutorial utiliza Hermes Agent, que incluye soporte nativo para este sistema de relay, para generar tres tipos de salida: registros del Formato de Observabilidad de Trayectoria del Agente (ATOF), registros paso a paso del Formato de Intercambio de Trayectoria del Agente (ATIF) y spans de OpenTelemetry etiquetados con estándares OpenInference.

El artículo detalla dos experimentos específicos. El primero implica una tarea simple de terminal donde el agente ejecuta un script en un contenedor Docker aislado para imprimir "VALUE=42". Esto verifica la configuración básica, asegurando que el agente pueda invocar herramientas y producir archivos de traza sin acceso a la red. El segundo experimento es más complejo, requiriendo que el agente lea un registro de viaje, busque en la web, verifique detalles de una conferencia en un sitio oficial y escriba un informe identificando "COLT 2026". Este proceso de múltiples pasos demuestra cómo las trazas capturan interacciones entre diferentes herramientas y servicios externos.

Más allá de la depuración individual, la publicación destaca un estudio de caso de benchmark llamado Hermes ToolPerf. Los investigadores utilizaron las trazas de NeMo Relay para evaluar cambios en el harness del agente a lo largo de 108 ejecuciones. Compararon una versión base contra una versión revisada con correcciones en la capa de herramientas. Los datos revelaron compensaciones que las métricas simples de éxito pasarían por alto, como el aumento de la latencia y el uso de tokens incluso cuando las tasas de finalización de tareas mejoraban.

Cómo funciona

NeMo Relay funciona interceptando el flujo de trabajo del agente en puntos clave del ciclo de vida. Trata las sesiones, turnos, llamadas al modelo y llamadas a herramientas como ámbitos jerárquicos. Cuando comienza o termina el trabajo, el relay registra el evento con marcas de tiempo precisas y relaciones padre-hijo. Esta estructura permite a los desarrolladores reconstruir la secuencia exacta de acciones tomadas por el agente.

El sistema exporta estos datos en formatos adecuados para diferentes necesidades de análisis. ATOF proporciona un registro JSONL crudo ideal para auditar tiempos y estados de error. ATIF ensambla estos eventos en una narrativa legible de las decisiones del agente. Para la inspección visual, el relay utiliza un exportador OpenInference para enviar datos mediante el Protocolo OpenTelemetry (OTLP) a backends compatibles. En el tutorial, este backend es Arize Phoenix, que muestra las trazas como gráficos interactivos que presentan entradas del modelo, salidas de herramientas y métricas de duración.

Detalles clave

  • NeMo Relay captura tres formatos de salida: ATOF para registros de eventos, ATIF para trayectorias paso a paso y spans de OpenTelemetry para visualización.
  • El tutorial requiere macOS o Linux, Docker, Git y una clave API de NVIDIA Build para Nemotron 3.5 Lightning.
  • Se utilizan Hermes Agent versión 0.21.1 y NeMo Relay versión 0.8.3 en los ejemplos proporcionados.
  • La tarea de investigación multi-herramienta identificó correctamente "COLT 2026" tras leer archivos, buscar en la web y verificar fuentes.
  • En el benchmark ToolPerf, Qwen Coder 30B mejoró el éxito de tareas del 70% al 81% con las correcciones, pero aumentó la duración media de 27s a 42s.
  • Las trazas pueden contener datos sensibles como prompts y rutas de archivo, por lo que la documentación recomienda revisarlas antes de compartirlas.

Por qué importa

Para los ingenieros que construyen agentes autónomos, una respuesta final correcta no garantiza un proceso eficiente o seguro. Un agente podría tener éxito por suerte, reintentando búsquedas fallidas varias veces o realizando llamadas redundantes a la API. Sin visibilidad sobre estos pasos intermedios, los desarrolladores no pueden optimizar costos, latencia o confiabilidad. NeMo Relay proporciona la capa de evidencia necesaria para distinguir entre un rendimiento robusto y parches frágiles.

Esta observabilidad es crítica para entornos de producción donde los agentes interactúan con herramientas externas y datos. Al capturar trazas estructuradas, los equipos pueden auditar el comportamiento para cumplir con normas de seguridad y depurar fallos que ocurren solo bajo condiciones específicas. La capacidad de comparar harnesses base y revisados utilizando métricas consistentes permite mejoras basadas en datos en lugar de suposiciones. A medida que los agentes se vuelven más complejos, entender el "cómo" se vuelve tan importante como el "qué".

Qué puedes hacer

  • Clona el repositorio complementario desde GitHub para acceder a los ejemplos ejecutables y scripts de verificación.
  • Configura un entorno de ejecución aislado usando el script de instalación proporcionado para evitar conflictos con entornos Python existentes.
  • Ejecuta primero la tarea simple de terminal para verificar que Docker, Hermes y NeMo Relay estén configurados correctamente.
  • Inspecciona los archivos ATOF y ATIF generados para entender la estructura cruda de los eventos y trayectorias del agente.
  • Despliega Arize Phoenix localmente y ejecuta la tarea de investigación multi-herramienta para visualizar los spans de OpenTelemetry en una interfaz gráfica.
  • Utiliza los datos de traza para evaluar cualquier cambio en tus prompts de agente o configuraciones de herramientas antes de desplegarlos en producción.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos