Agents IA

Débogage des agents IA avec NVIDIA NeMo Relay et OpenTelemetry

NVIDIA NeMo Relay ajoute une observabilité à Hermes Agent, capturant des traces d'exécution détaillées pour le débogage et l'évaluation des performances.

Traduit automatiquement depuis l'original anglais.

NVIDIA a publié un tutoriel technique démontrant comment tracer et déboguer le comportement des agents IA à l'aide de NeMo Relay. Le guide se concentre sur le framework Hermes Agent, montrant aux développeurs comment capturer des événements de cycle de vie structurés et les visualiser dans des outils comme Arize Phoenix. Publié fin septembre 2026, cette ressource vise à résoudre le problème de la boîte noire inhérent aux systèmes autonomes complexes.

Ce qui s'est passé

Le blog technique de NVIDIA a publié un guide pratique pour mettre en œuvre l'observabilité dans les agents IA. Le sujet central est NeMo Relay, une couche qui enregistre les événements ordonnés et les trajectoires lors de l'exécution de l'agent. Le tutoriel utilise Hermes Agent, qui prend nativement en charge ce système de relais, pour générer trois types de sortie : les journaux du format d'observabilité des trajectoires d'agents (ATOF), les enregistrements étape par étape du format d'échange des trajectoires d'agents (ATIF) et les spans OpenTelemetry étiquetés selon les normes OpenInference.

L'article détaille deux expériences spécifiques. La première implique une tâche simple de terminal où l'agent exécute un script dans un conteneur Docker isolé pour afficher "VALUE=42". Cela vérifie la configuration de base, garantissant que l'agent peut invoquer des outils et produire des fichiers de trace sans accès réseau. La seconde expérience est plus complexe, nécessitant que l'agent lise un dossier de voyage, recherche sur le web, vérifie les détails d'une conférence sur un site officiel et rédige un rapport identifiant "COLT 2026". Ce processus multi-étapes démontre comment les traces capturent les interactions entre différents outils et services externes.

Au-delà du débogage individuel, le post met en avant une étude de cas de benchmark appelée Hermes ToolPerf. Les chercheurs ont utilisé les traces de NeMo Relay pour évaluer les modifications apportées au harnais de l'agent sur 108 exécutions. Ils ont comparé une version de base à une version révisée intégrant des correctifs au niveau des outils. Les données ont révélé des compromis que les simples métriques de succès auraient manquées, tels qu'une augmentation de la latence et de l'utilisation des tokens même lorsque les taux d'achèvement des tâches s'amélioraient.

Comment cela fonctionne

NeMo Relay fonctionne en interceptant le flux de travail de l'agent aux points clés du cycle de vie. Il traite les sessions, les tours, les appels de modèle et les appels d'outils comme des portées hiérarchiques. Lorsque le travail commence ou se termine, le relais enregistre l'événement avec des horodatages précis et des relations parent-enfant. Cette structure permet aux développeurs de reconstruire la séquence exacte des actions entreprises par l'agent.

Le système exporte ces données dans des formats adaptés à différents besoins d'analyse. ATOF fournit un journal JSONL brut idéal pour auditer le timing et les états d'erreur. ATIF assemble ces événements en un récit lisible des décisions de l'agent. Pour l'inspection visuelle, le relais utilise un exportateur OpenInference pour envoyer les données via le protocole OpenTelemetry (OTLP) vers des backends compatibles. Dans le tutoriel, ce backend est Arize Phoenix, qui affiche les traces sous forme de graphiques interactifs montrant les entrées du modèle, les sorties des outils et les métriques de durée.

Détails clés

  • NeMo Relay capture trois formats de sortie : ATOF pour les journaux d'événements, ATIF pour les trajectoires étape par étape, et les spans OpenTelemetry pour la visualisation.
  • Le tutoriel nécessite macOS ou Linux, Docker, Git et une clé API NVIDIA Build pour Nemotron 3.5 Lightning.
  • Les versions Hermes Agent 0.21.1 et NeMo Relay 0.8.3 sont utilisées dans les exemples fournis.
  • La tâche de recherche multi-outils a réussi à identifier "COLT 2026" après avoir lu des fichiers, effectué des recherches web et vérifié les sources.
  • Dans le benchmark ToolPerf, Qwen Coder 30B a amélioré le taux de réussite des tâches de 70 % à 81 % grâce aux correctifs, mais a augmenté la durée moyenne de 27 s à 42 s.
  • Les traces peuvent contenir des données sensibles telles que les prompts et les chemins de fichiers ; la documentation conseille donc de les examiner avant tout partage.

Pourquoi c'est important

Pour les ingénieurs construisant des agents autonomes, une réponse finale correcte ne garantit pas un processus efficace ou sûr. Un agent peut réussir par chance, en réessayant plusieurs fois des recherches échouées ou en effectuant des appels API redondants. Sans visibilité sur ces étapes intermédiaires, les développeurs ne peuvent pas optimiser les coûts, la latence ou la fiabilité. NeMo Relay fournit la couche de preuve nécessaire pour distinguer une performance robuste des solutions fragiles.

Cette observabilité est cruciale pour les environnements de production où les agents interagissent avec des outils et des données externes. En capturant des traces structurées, les équipes peuvent auditer le comportement pour la conformité à la sécurité et déboguer les défaillances qui ne surviennent que dans des conditions spécifiques. La capacité de comparer les harnais de base et révisés en utilisant des métriques cohérentes permet des améliorations basées sur les données plutôt que sur des suppositions. À mesure que les agents deviennent plus complexes, comprendre le "comment" devient aussi important que le "quoi".

Ce que vous pouvez faire

  • Clonez le dépôt compagnon depuis GitHub pour accéder aux exemples exécutables et aux scripts de vérification.
  • Configurez un environnement d'exécution isolé à l'aide du script d'installation fourni pour éviter les conflits avec les environnements Python existants.
  • Exécutez d'abord la tâche simple de terminal pour vérifier que Docker, Hermes et NeMo Relay sont correctement configurés.
  • Inspectez les fichiers ATOF et ATIF générés pour comprendre la structure brute des événements et des trajectoires de l'agent.
  • Déployez Arize Phoenix localement et exécutez la tâche de recherche multi-outils pour visualiser les spans OpenTelemetry dans une interface graphique.
  • Utilisez les données de trace pour évaluer toute modification apportée à vos prompts d'agent ou configurations d'outils avant leur déploiement en production.

Outils de la Boutique Bytechap

Continuer la lecture

Tous les articles