NVIDIA NeMo RelayとOpenTelemetryによるAIエージェントのデバッグ
NVIDIA NeMo RelayはHermes Agentに可観測性を追加し、デバッグやパフォーマンス評価のために詳細な実行トレースを記録します。
英語の原文から自動翻訳されました。
NVIDIAは、NeMo Relayを使用してAIエージェントの動作を追跡・デバッグする方法を示す技術チュートリアルを公開しました。このガイドではHermes Agentフレームワークに焦点を当て、開発者が構造化されたライフサイクルイベントをキャプチャし、Arize Phoenixなどのツールで可視化する方法を紹介しています。2026年9月下旬に公開されたこのリソースは、複雑な自律型システムに inherent なブラックボックス問題を解決することを目的としています。
何が起きたか
NVIDIA Technical Blogは、AIエージェントにおける可観測性を実装するための実践的な手順を公開しました。中心となるテーマはNeMo Relayであり、これはエージェントの実行中に順序だったイベントや軌跡を記録するレイヤーです。チュートリアルでは、このリレーシステムへのネイティブサポートを含むHermes Agentを使用し、3種類の出力を生成します。それは、Agent Trajectory Observability Format(ATOF)ログ、Agent Trajectory Interchange Format(ATIF)ステップバイステップレコード、そしてOpenInference標準でラベル付けされたOpenTelemetryスパンです。
記事では2つの具体的な実験について詳しく説明しています。1つ目は、エージェントが隔離されたDockerコンテナ内で「VALUE=42」を表示するスクリプトを実行するシンプルなターミナルタスクです。これにより基本的なセットアップを検証し、エージェントがネットワークアクセスなしでツールを呼び出し、トレースファイルを生成できることを確認します。2つ目の実験はより複雑で、エージェントが旅行記録を読み取り、Web検索を行い、公式サイトで会議の詳細を確認し、「COLT 2026」を特定するレポートを作成する必要があります。このマルチステップのプロセスは、異なるツールや外部サービス間のインタラクションをトレースがどのようにキャプチャするかを示しています。
個々のデバッグに加え、投稿ではHermes ToolPerfというベンチマークケーススタディも強調されています。研究者たちはNeMo Relayのトレースを用いて、108回のランにおいてエージェントハーネスの変更を評価しました。彼らはベースラインバージョンと、ツール層の修正を加えた改訂版を比較しました。データからは、単純な成功指標では見逃されるトレードオフが明らかになりました。例えば、タスク完了率が向上しても、レイテンシやトークン使用量が増加する場合などです。
仕組み
NeMo Relayは、主要なライフサイクルポイントでエージェントのワークフローをインターセプトすることで機能します。セッション、ターン、モデル呼び出し、ツール呼び出しを階層的なスコープとして扱います。作業の開始時または終了時に、リレーは正確なタイムスタンプと親子関係とともにイベントを記録します。この構造により、開発者はエージェントが実行したアクションの正確なシーケンスを再構築できます。
システムはこのデータを、さまざまな分析ニーズに適した形式でエクスポートします。ATOFはタイミングやエラー状態の監査に最適な生JSONLログを提供します。ATIFはこれらのイベントを、エージェントの意思決定に関する読みやすいナラティブにまとめます。視覚的検査のため、リレーはOpenInferenceエクスポーターを使用し、OpenTelemetry Protocol(OTLP)を介して互換性のあるバックエンドへデータを送信します。チュートリアルでは、このバックエンドとしてArize Phoenixを使用しており、モデル入力、ツール出力、持続時間メトリクスを表示するインタラクティブグラフとしてトレースを描画します。
重要な詳細
- NeMo Relayは3つの出力形式をキャプチャします。イベントログ用のATOF、ステップバイステップの軌跡用ATIF、可視化用のOpenTelemetryスパンです。
- チュートリアルにはmacOSまたはLinux、Docker、Git、およびNemotron 3.5 Lightning用のNVIDIA Build APIキーが必要です。
- 提供されている例では、Hermes Agent バージョン0.21.1とNeMo Relay バージョン0.8.3が使用されています。
- マルチツール調査タスクでは、ファイルの読み取り、Web検索、ソースの確認を経て、「COLT 2026」の特定に成功しました。
- ToolPerfベンチマークでは、Qwen Coder 30Bは修正によりタスク成功率を70%から81%へ向上させましたが、平均所要時間は27秒から42秒へ増加しました。
- トレースにはプロンプトやファイルパスなどの機密データが含まれる可能性があるため、共有前にレビューすることがドキュメントで推奨されています。
なぜ重要なのか
自律型エージェントを構築するエンジニアにとって、最終的な回答が正しくても、効率的かつ安全なプロセスである保証はありません。エージェントは運よく成功したり、失敗した検索を複数回リトライしたり、冗長なAPI呼び出しを行ったりする可能性があります。これらの中間ステップに対する可視性がなければ、開発者はコスト、レイテンシ、信頼性の最適化を行うことができません。NeMo Relayは、堅牢なパフォーマンスと脆いハックを区別するために必要な証拠レイヤーを提供します。
この可観測性は、エージェントが外部ツールやデータとやり取りする本番環境において極めて重要です。構造化されたトレースをキャプチャすることで、チームはセキュリティコンプライアンスのための動作監査や、特定の条件下でのみ発生する障害のデバッグが可能になります。一貫したメトリクスを使用してベースラインと改訂版ハーネスを比較できる能力により、推測ではなくデータ駆動型の改善が行えます。エージェントが複雑になるにつれ、「何を」成し遂げたかだけでなく、「どのように」成し遂げたかを理解することが同等に重要になってきます。
あなたができること
- GitHubから付随するリポジトリをクローンし、実行可能なサンプルや検証スクリプトにアクセスしてください。
- 既存のPython環境との競合を避けるため、提供されているセットアップスクリプトを使用して隔離されたランタイムを設定してください。
- Docker、Hermes、NeMo Relayが正しく設定されていることを確認するため、まずシンプルなターミナルタスクを実行してください。
- 生成されたATOFおよびATIFファイルを検査し、エージェントイベントと軌跡の生構造を理解してください。
- Arize Phoenixをローカルにデプロイし、マルチツール調査タスクを実行して、グラフィカルインターフェースでOpenTelemetryスパンを可視化してください。
- エージェントのプロンプトやツール構成への変更を本番環境へデプロイする前に、トレースデータを使用して評価してください。

