Xây dựng với AI

ProvenanceGuard xác minh nguồn gốc trích dẫn trong các agent MCP

Một lớp xác minh mới phát hiện khi các AI agent gán sai nguồn dữ liệu cho các sự kiện, ngăn ngừa tình trạng nhầm lẫn giữa các nguồn trong quy trình làm việc đa công cụ.

Được dịch tự động từ bản gốc tiếng Anh.

Các nhà nghiên cứu đã giới thiệu ProvenanceGuard, một phương pháp xác minh được thiết kế để đảm bảo rằng các AI agent gán đúng nguồn dữ liệu cho các thông tin. Được Hugging Face công bố vào ngày 29 tháng 9 năm 2026, cách tiếp cận này giải quyết các lỗi mà ở đó những phát biểu đúng lại bị liên kết với đầu ra của công cụ sai trong các hệ thống Model Context Protocol (MCP).

Chuyện gì đã xảy ra

Các AI agent hiện đại thường sử dụng Model Context Protocol để truy cập đồng thời nhiều công cụ. Một agent có thể truy vấn cơ sở dữ liệu, tìm kiếm kho tài liệu và kiểm tra các bản ghi có cấu trúc trước khi tạo ra một phản hồi duy nhất. Trong khi các phương pháp đánh giá hiện tại kiểm tra xem một tuyên bố có được hỗ trợ bởi bất kỳ bằng chứng khả dụng nào hay không, chúng thường thất bại trong việc xác minh xem tuyên bố đó có được hỗ trợ bởi chính nguồn cụ thể mà agent trích dẫn hay không. Điều này dẫn đến một chế độ lỗi được gọi là nhầm lẫn giữa các nguồn (cross-source conflation), nơi một sự kiện là đúng nhưng lại được gán cho sai nguồn gốc.

ProvenanceGuard hoạt động như một lớp xác minh sau khi tạo nội dung, nằm trên cùng của một agent MCP mà không yêu cầu đào tạo lại mô hình. Nó phân tích dấu vết (trace) đã thu thập về đầu ra của công cụ và ID nguồn để xác định xem mỗi tuyên bố trong câu trả lời có khớp với nguồn được nêu hoặc ngụ ý hay không. Hệ thống phân tách câu trả lời thành các tuyên bố riêng lẻ, điều hướng mỗi tuyên bố đến nguồn liên quan nhất và kiểm tra sự hỗ trợ bằng các mô hình suy luận ngôn ngữ tự nhiên. Nếu phát hiện sự không khớp, hệ thống có thể chặn câu trả lời hoặc kích hoạt quy trình sửa chữa.

Các nhà nghiên cứu đã thử nghiệm phương pháp này trên một agent y tế truy cập hồ sơ bệnh nhân và các bài báo nghiên cứu. Trong một nghiên cứu liên quan đến 281 dấu vết thực tế, các chuyên gia con người đã đánh giá 361 tuyên bố từ một tập dữ liệu giữ lại (held-out set). ProvenanceGuard đã xác định 138 trong số 139 tuyên bố cần bị từ chối do gán sai nguồn hoặc thiếu sự hỗ trợ. Nó đạt điểm F1 về việc từ chối/chặn là 0,802, vượt trội so với các baseline mù nguồn (source-blind baselines) như MiniCheck và RAGAS Faithfulness, đồng thời cung cấp các phán quyết nguồn cho từng tuyên bố.

Cách thức hoạt động

ProvenanceGuard duy trì danh tính nguồn xuyên suốt quy trình xác minh thay vì gom tất cả bằng chứng vào một ngữ cảnh duy nhất. Khi một agent tạo ra câu trả lời, hệ thống sẽ phân rã nó thành các tuyên bố cụ thể. Sau đó, nó sử dụng các mô hình embedding, chẳng hạn như MiniLM, để tìm nguồn liên quan nhất đến từng tuyên bố. Một mô hình suy luận ngôn ngữ tự nhiên DeBERTa kiểm tra xem nguồn cụ thể đó có thực sự hỗ trợ tuyên bố hay không. Cuối cùng, hệ thống so sánh nguồn hỗ trợ với nguồn được nêu tên hoặc ngụ ý trong văn bản câu trả lời.

Quy trình xác minh bao gồm một bước ra quyết định được hiệu chỉnh, kết hợp các tín hiệu này để cho phép hoặc chặn câu trả lời. Nếu một câu trả lời bị chặn, một vòng lặp sửa chữa tương tự như RARR có thể cố gắng thực hiện một phiên bản sửa đổi dựa trên nguồn hoặc cung cấp một phương án dự phòng an toàn. Trong cấu hình cục bộ được báo cáo, quy trình này thêm khoảng nửa giây độ trễ cho mỗi câu trả lời. Hệ thống dựa vào các mô hình cục bộ để xử lý ngoại tuyến có kiểm soát, mặc dù kiến trúc có thể được điều chỉnh cho các dịch vụ dựa trên đám mây.

Chi tiết chính

  • ProvenanceGuard phát hiện nhầm lẫn giữa các nguồn, nơi một sự kiện đúng được gán cho đầu ra của công cụ sai.
  • Hệ thống đạt điểm F1 0,802 cho việc chặn các tuyên bố sai, vượt qua các bộ xác minh mù nguồn.
  • Nó xác định đúng nguồn cho các tuyên bố khoảng 86% thời gian trong các bài kiểm tra với các nguồn riêng biệt.
  • Lớp xác minh thêm khoảng 500 mili giây độ trễ cho mỗi câu trả lời trong thiết lập cục bộ được thử nghiệm.
  • Trong một bài kiểm tra có kiểm soát với 50 trường hợp hoán đổi gán nguồn, phương pháp này đã bắt được tất cả 50 lỗi.
  • Cách tiếp cận này hoạt động với các agent MCP hiện có bằng cách phân tích dấu vết mà không yêu cầu đào tạo lại mô hình.

Tại sao điều này quan trọng

Đối với các nhà phát triển xây dựng hệ thống AI tài liệu đáng tin cậy, đảm bảo độ chính xác về mặt sự kiện là không đủ nếu nguồn gốc (provenance) bị sai. Trong các lĩnh vực nhạy cảm như y tế hoặc tài chính, việc trích dẫn một tài liệu chính sách chung thay vì một hồ sơ bệnh nhân cụ thể có thể dẫn đến các vấn đề tuân thủ nghiêm trọng hoặc rủi ro an toàn. Xác minh nhận biết nguồn cung cấp mức độ chi tiết cần thiết để tin tưởng các agent tự động trong môi trường rủi ro cao. Nó biến tính chân thực từ một kiểm tra nhị phân thành một dấu vết kiểm toán chi tiết liên kết mọi tuyên bố với nguồn gốc của nó.

Phương pháp này cũng cải thiện việc gỡ lỗi và bảo trì các quy trình làm việc của agent. Bằng cách phơi bày đầu ra công cụ nào hỗ trợ cho mỗi tuyên bố, các kỹ sư có thể xác định các điểm yếu trong quy trình truy xuất của họ. Nó cho phép các nhóm phân biệt giữa một agent thiếu thông tin và một agent gán sai thông tin. Sự khác biệt này rất quan trọng để tinh chỉnh chiến lược prompt và lựa chọn các công cụ phù hợp cho các tác vụ cụ thể.

Bạn có thể làm gì

  • Triển khai theo dõi ID nguồn trong đầu ra công cụ MCP của bạn để cho phép xác minh ở hạ lưu.
  • Đánh giá hệ thống RAG hoặc agent hiện tại của bạn về nhầm lẫn giữa các nguồn bằng cách sử dụng các tập dữ liệu kiểm tra giữ lại.
  • Cân nhắc thêm một bước xác minh sau khi tạo nội dung để kiểm tra sự liên kết giữa tuyên bố và nguồn.
  • Sử dụng các mô hình NLI cục bộ để nguyên mẫu ban đầu cho xác minh nhận biết nguồn trước khi mở rộng sang các dịch vụ đám mây.
  • Thiết kế prompt của agent để nêu rõ nguồn của từng tuyên bố nhằm tạo điều kiện thuận lợi cho việc kiểm tra tự động.
  • Kiểm thử hệ thống của bạn với các trường hợp hoán đổi gán nguồn để đo độ nhạy cảm của nó đối với các lỗi nguồn gốc.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết