Google Research đề xuất tính toàn vẹn theo ngữ cảnh để bảo mật cho các tác nhân AI tự chủ
Một báo cáo mới từ Google Research lập luận rằng các tác nhân AI cần hiểu rõ các chuẩn mực xã hội và ngữ cảnh để đảm bảo quyền riêng tư và an ninh, vượt ra ngoài các mô hình cấp quyền truyền thống.
Được dịch tự động từ bản gốc tiếng Anh.
Google Research đã công bố một báo cáo hội thảo toàn diện, phác thảo một khuôn khổ mới nhằm bảo mật các tác nhân AI tự chủ. Được công bố vào tháng 10 năm 2026, tài liệu có tiêu đề "Các vấn đề mở và nổi lên trong quyền riêng tư và an ninh của tác nhân: Một góc nhìn theo ngữ cảnh" (Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle) tập hợp những hiểu biết sâu sắc từ hơn 50 nhà lãnh đạo học thuật và ngành công nghiệp. Báo cáo lập luận rằng các mô hình bảo mật truyền thống là không đủ đối với các tác nhân tạo sinh và đề xuất áp dụng lý thuyết về Tính Toàn Vẹn Theo Ngữ Cảnh (Contextual Integrity) để xác định các luồng thông tin phù hợp.
Điều gì đã xảy ra
Báo cáo bắt nguồn từ Hội thảo về Quyền riêng tư và An ninh Tác nhân Theo ngữ cảnh của Google (CAPS Workshop) được tổ chức tại Thành phố New York vào cuối năm 2025. Khi các mô hình ngôn ngữ lớn phát triển thành các tác nhân có khả năng lập kế hoạch động và gọi công cụ, chúng đặt ra những rủi ro độc đáo mà phần mềm xác định không gặp phải. Các tác giả chỉ ra rằng để các tác nhân hữu ích, chúng cần truy cập vào dữ liệu cá nhân và khả năng thực hiện các hành động có hệ quả trong nhiều ngữ cảnh khác nhau. Sự kết hợp này tạo ra một căng thẳng giữa năng lực và sự an toàn mà các phương pháp kỹ thuật hiện tại đang chật vật để giải quyết.
Luận điểm cốt lõi là quyền riêng tư không nên được xem đơn thuần là sự bí mật hay kiểm soát của người dùng, mà là "luồng thông tin phù hợp" dựa trên các chuẩn mực xã hội. Báo cáo mở rộng khái niệm này, được gọi là Tính Toàn Vẹn Theo Ngữ Cảnh, để bao quát không chỉ việc chia sẻ dữ liệu mà còn cả sự phù hợp của các hành động do tác nhân thực hiện. Bằng cách neo giữ bảo mật vào các chuẩn mực ngữ cảnh này, các nhà nghiên cứu hướng tới việc tạo ra các hệ thống có thể đánh giá xem một hành động có được xã hội chấp nhận trước khi thực thi nó hay không, thay vì chỉ dựa vào các quyền hạn tĩnh.
Cách thức hoạt động
Tính Toàn Vẹn Theo Ngữ Cảnh xác định các chuẩn mực quyền riêng tư thông qua ba thành phần: các bên liên quan, loại thông tin và nguyên tắc truyền tải. Các bên liên quan bao gồm ai gửi và nhận thông tin. Loại thông tin đề cập đến các danh mục cụ thể như hồ sơ y tế hoặc tài chính. Nguyên tắc truyền tải là các quy tắc điều chỉnh dòng chảy, chẳng hạn như tính bảo mật hoặc sự tương hỗ. Ví dụ, một người dùng có thể cho phép trợ lý mua sắm xem danh sách quà tặng nhưng không chia sẻ nó với bạn bè. Báo cáo gợi ý rằng các LLM có thể thu hẹp khoảng cách ngữ nghĩa giữa các chuẩn mực ở cấp độ cao và các quyền hạn hệ thống ở cấp độ thấp bằng cách tạo ra các chính sách có thể đọc bởi máy, thích ứng với các ngữ cảnh cụ thể theo thời gian thực.
Để đưa khái niệm này vào vận hành, báo cáo đề xuất một kiến trúc đa lớp tập trung vào một công cụ chính sách ngữ cảnh. Công cụ này đóng vai trò là một lớp giám sát theo dõi hành vi của tác nhân. Nó bao gồm một vòng lặp tạo chính sách động, tùy chỉnh các quy tắc theo yêu cầu của người dùng và ngữ cảnh mở, bao gồm cả các công cụ mới được phát hiện trong quá trình chạy. Trước khi bất kỳ dữ liệu nào rời khỏi không gian làm việc của người dùng, hệ thống sẽ đánh giá xem luồng dự kiến có phù hợp với các chuẩn mực ngữ cảnh đã thiết lập hay không. Phương pháp tiếp cận này bổ sung cho suy luận ở cấp độ mô hình và các biện pháp kiểm soát lấy người dùng làm trung tâm để tạo ra một cơ chế phòng thủ vững chắc.
Chi tiết chính
- Báo cáo xác định ba chiều kích quan trọng nơi các tác nhân khác biệt so với phần mềm truyền thống: giao diện phi cấu trúc, luồng điều khiển xác suất và tính tự chủ kèm theo ủy quyền.
- Các phương pháp thử nghiệm truyền thống gặp khó khăn trong việc bảo mật lập kế hoạch tạo sinh vì các đường dẫn thực thi mang tính xác suất chứ không phải xác định.
- Việc giám sát của người dùng trở nên kém hiệu quả hơn do "sự mệt mỏi khi xác nhận" khi các tác nhân xử lý các nhiệm vụ dài hơn và ủy quyền các nhiệm vụ phụ cho các tác nhân khác.
- Giải pháp được đề xuất liên quan đến một công cụ chính sách ngữ cảnh tạo ra các chính sách động để thực thi sự phù hợp trước khi truyền dữ liệu.
- Việc cô lập hệ thống (sandboxing) cho các tác nhân phải phát triển từ các giới hạn tĩnh sang các hạn chế năng lực động dựa trên các ngữ cảnh thay đổi.
- Các tác giả kêu gọi các tiêu chuẩn benchmark đa tác nhân, được mô tả là các môi trường "Agent Gym", để mô phỏng các tương tác phức tạp nhằm đánh giá mức độ an toàn.
Tại sao điều này quan trọng
Đối với các kỹ sư xây dựng hệ thống tác nhân, báo cáo này nhấn mạnh những hạn chế của các mô hình cấp quyền hiện tại. Các khuôn khổ "Thông báo và Lựa chọn" (Notice and Choice) truyền thống giả định rằng người dùng có thể đưa ra các quyết định chi tiết về các hành động có thể dự đoán trước. Tuy nhiên, các tác nhân tự chủ hoạt động theo cách khối lượng lớn và mang tính xác suất, khiến việc dự đoán trước trở nên bất khả thi. Việc dựa vào các quyền hạn tĩnh hoặc các chính sách do chuyên gia viết thủ công không thể mở rộng quy mô cho các tác nhân thực hiện các nhiệm vụ phức tạp, kéo dài trên nhiều lĩnh vực. Các nhà phát triển cần các cơ chế mới cho phép các tác nhân suy luận về sự phù hợp dưới các chuẩn mực thay đổi mà không cần sự can thiệp liên tục của con người.
Sự chuyển dịch sang bảo mật theo ngữ cảnh cũng ảnh hưởng đến cách các nhóm tiếp cận việc thử nghiệm và quản trị. Vì các tác nhân có thể thông đồng hoặc vi phạm các chuẩn mực trong các tương tác đa tác nhân, các bài kiểm tra đơn vị (unit tests) đơn giản là không đủ. Báo cáo nhấn mạnh sự cần thiết của quản trị ở cấp độ hệ sinh thái để giải quyết các xung đột giữa các chuẩn mực khác nhau trên các lĩnh vực. Bằng cách áp dụng lăng kính ngữ cảnh, các tổ chức có thể xây dựng lòng tin không chỉ bằng cách ngăn chặn rò rỉ dữ liệu, mà còn bằng cách đảm bảo các tác nhân hành động theo cách phù hợp với kỳ vọng của người dùng và các tiêu chuẩn xã hội trong những tình huống cụ thể.
Bạn có thể làm gì
- Đánh giá các kiến trúc tác nhân hiện tại để xác định những điểm mà các quyền hạn tĩnh không nắm bắt được các sắc thái ngữ cảnh trong việc xử lý dữ liệu.
- Khám phá việc triển khai một lớp giám sát hoặc công cụ chính sách có thể chặn và xác thực các hành động của tác nhân dựa trên các quy tắc ngữ cảnh động.
- Thiết kế các giao diện người dùng thoát khỏi các hộp thoại đồng ý một lần, hướng tới các cơ chế kiểm soát liên tục, theo ngữ cảnh, phù hợp với mô hình tinh thần của người dùng.
- Nghiên cứu các kỹ thuật sandboxing động có thể thu hồi hoặc cấp quyền truy cập của tác nhân vào các công cụ và dữ liệu dựa trên những thay đổi ngữ cảnh theo thời gian thực.
- Tham gia hoặc theo dõi sự phát triển của các môi trường mô phỏng đa tác nhân để đánh giá mức độ an toàn và hành vi quyền riêng tư trong các kịch bản phức tạp.
- Hợp tác với các nhóm liên chức năng để xác định các chuẩn mực ngữ cảnh rõ ràng cho các trường hợp sử dụng cụ thể, ghi chép lại các bên liên quan, loại thông tin và nguyên tắc truyền tải.



