AI agent

Gỡ lỗi các tác nhân AI với NVIDIA NeMo Relay và OpenTelemetry

NVIDIA NeMo Relay bổ sung khả năng quan sát cho Hermes Agent, ghi lại các dấu vết thực thi chi tiết để phục vụ việc gỡ lỗi và đánh giá hiệu suất.

Được dịch tự động từ bản gốc tiếng Anh.

NVIDIA đã phát hành một hướng dẫn kỹ thuật minh họa cách theo dõi và gỡ lỗi hành vi của tác nhân AI bằng NeMo Relay. Tài liệu tập trung vào framework Hermes Agent, hướng dẫn lập trình viên cách thu thập các sự kiện vòng đời có cấu trúc và trực quan hóa chúng trong các công cụ như Arize Phoenix. Được xuất bản vào cuối tháng 9 năm 2026, tài nguyên này nhằm giải quyết vấn đề "hộp đen" vốn tồn tại trong các hệ thống tự động phức tạp.

Điều gì đã xảy ra

Blog Kỹ thuật NVIDIA đã đăng tải một bài hướng dẫn thực tế về việc triển khai khả năng quan sát trong các tác nhân AI. Chủ đề cốt lõi là NeMo Relay, một lớp ghi lại các sự kiện có thứ tự và quỹ đạo hoạt động trong quá trình thực thi của tác nhân. Hướng dẫn sử dụng Hermes Agent, vốn hỗ trợ sẵn hệ thống relay này, để tạo ra ba loại đầu ra: nhật ký định dạng ATOF (Agent Trajectory Observability Format), hồ sơ từng bước ATIF (Agent Trajectory Interchange Format) và các span OpenTelemetry được gắn nhãn theo tiêu chuẩn OpenInference.

Bài viết mô tả chi tiết hai thí nghiệm cụ thể. Thí nghiệm đầu tiên liên quan đến một tác vụ terminal đơn giản, nơi tác nhân chạy một script trong container Docker cô lập để in ra "VALUE=42". Điều này xác minh thiết lập cơ bản, đảm bảo rằng tác nhân có thể gọi các công cụ và tạo ra các tệp dấu vết mà không cần truy cập mạng. Thí nghiệm thứ hai phức tạp hơn, yêu cầu tác nhân đọc hồ sơ du lịch, tìm kiếm trên web, xác minh chi tiết hội nghị trên trang chính thức và viết một báo cáo xác định "COLT 2026". Quy trình nhiều bước này minh họa cách các dấu vết ghi lại tương tác giữa các công cụ khác nhau và dịch vụ bên ngoài.

Ngoài việc gỡ lỗi cá nhân, bài đăng còn nhấn mạnh một nghiên cứu tình huống benchmark mang tên Hermes ToolPerf. Các nhà nghiên cứu đã sử dụng dấu vết từ NeMo Relay để đánh giá những thay đổi đối với harness của tác nhân qua 108 lần chạy. Họ so sánh phiên bản cơ sở với phiên bản sửa đổi chứa các bản vá ở tầng công cụ. Dữ liệu đã tiết lộ những sự đánh đổi mà các chỉ số thành công đơn giản sẽ bỏ sót, chẳng hạn như độ trễ và mức tiêu thụ token tăng lên ngay cả khi tỷ lệ hoàn thành nhiệm vụ cải thiện.

Cách thức hoạt động

NeMo Relay hoạt động bằng cách chặn quy trình làm việc của tác nhân tại các điểm then chốt trong vòng đời. Nó coi các phiên, lượt, lệnh gọi mô hình và lệnh gọi công cụ là các phạm vi phân cấp. Khi công việc bắt đầu hoặc kết thúc, relay ghi lại sự kiện với mốc thời gian chính xác và mối quan hệ cha-con. Cấu trúc này cho phép lập trình viên tái dựng chính xác chuỗi hành động mà tác nhân đã thực hiện.

Hệ thống xuất dữ liệu này dưới các định dạng phù hợp với nhu cầu phân tích khác nhau. ATOF cung cấp nhật ký JSONL thô, lý tưởng để kiểm toán thời gian và trạng thái lỗi. ATIF tổng hợp các sự kiện này thành một câu chuyện dễ đọc về các quyết định của tác nhân. Để kiểm tra trực quan, relay sử dụng trình xuất OpenInference để gửi dữ liệu qua Giao thức OpenTelemetry (OTLP) tới các backend tương thích. Trong hướng dẫn, backend này là Arize Phoenix, hiển thị các dấu vết dưới dạng đồ thị tương tác cho thấy đầu vào của mô hình, đầu ra của công cụ và các chỉ số về thời lượng.

Chi tiết chính

  • NeMo Relay thu thập ba định dạng đầu ra: ATOF cho nhật ký sự kiện, ATIF cho quỹ đạo từng bước và span OpenTelemetry để trực quan hóa.
  • Hướng dẫn yêu cầu macOS hoặc Linux, Docker, Git và khóa API NVIDIA Build cho Nemotron 3.5 Lightning.
  • Hermes Agent phiên bản 0.21.1 và NeMo Relay phiên bản 0.8.3 được sử dụng trong các ví dụ được cung cấp.
  • Tác vụ nghiên cứu đa công cụ đã xác định thành công "COLT 2026" sau khi đọc tệp, tìm kiếm trên web và xác minh nguồn.
  • Trong benchmark ToolPerf, Qwen Coder 30B đã cải thiện tỷ lệ thành công nhiệm vụ từ 70% lên 81% nhờ các bản vá, nhưng thời lượng trung bình tăng từ 27s lên 42s.
  • Dấu vết có thể chứa dữ liệu nhạy cảm như prompt và đường dẫn tệp, vì vậy tài liệu khuyến nghị xem xét kỹ trước khi chia sẻ.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng tác nhân tự động, một câu trả lời cuối cùng đúng đắn không đảm bảo quy trình hiệu quả hay an toàn. Một tác nhân có thể thành công do may mắn, thử lại nhiều lần các tìm kiếm thất bại hoặc thực hiện các lệnh gọi API dư thừa. Nếu không có cái nhìn sâu sắc vào các bước trung gian này, lập trình viên không thể tối ưu hóa chi phí, độ trễ hoặc độ tin cậy. NeMo Relay cung cấp lớp bằng chứng cần thiết để phân biệt giữa hiệu suất vững chắc và các thủ thuật mong manh.

Khả năng quan sát này rất quan trọng đối với môi trường sản xuất, nơi các tác nhân tương tác với công cụ và dữ liệu bên ngoài. Bằng cách thu thập các dấu vết có cấu trúc, các nhóm có thể kiểm toán hành vi để tuân thủ bảo mật và gỡ lỗi các sự cố chỉ xảy ra trong những điều kiện cụ thể. Khả năng so sánh harness cơ sở và harness sửa đổi bằng cách sử dụng các chỉ số nhất quán cho phép cải tiến dựa trên dữ liệu thay vì phỏng đoán. Khi các tác nhân trở nên phức tạp hơn, việc hiểu "cách thức" cũng quan trọng không kém việc biết "kết quả".

Bạn có thể làm gì

  • Nhân bản repository đi kèm từ GitHub để truy cập các ví dụ có thể chạy được và script xác minh.
  • Thiết lập môi trường runtime cô lập bằng script cài đặt được cung cấp để tránh xung đột với các môi trường Python hiện có.
  • Chạy tác vụ terminal đơn giản trước để xác minh rằng Docker, Hermes và NeMo Relay được cấu hình đúng.
  • Kiểm tra các tệp ATOF và ATIF được tạo ra để hiểu cấu trúc thô của các sự kiện và quỹ đạo của tác nhân.
  • Triển khai Arize Phoenix cục bộ và chạy tác vụ nghiên cứu đa công cụ để trực quan hóa các span OpenTelemetry trong giao diện đồ họa.
  • Sử dụng dữ liệu dấu vết để đánh giá bất kỳ thay đổi nào đối với prompt của tác nhân hoặc cấu hình công cụ trước khi triển khai chúng vào môi trường sản xuất.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết