Bảo mật & quyền riêng tư

CounterSteer bảo vệ các tác nhân LLM khỏi tấn công chèn prompt gián tiếp

Một cơ chế phòng thủ mới ở giai đoạn suy luận (inference-time) mang tên CounterSteer giúp ngăn chặn tấn công chèn prompt gián tiếp bằng cách trừ một vector kích hoạt cụ thể từ kết quả của công cụ, qua đó giảm đáng kể tỷ lệ thành công của cuộc tấn công mà không

Minh họa việc điều hướng kích hoạt loại bỏ một vector độc hại khỏi trạng thái nội bộ của mô hình.
Minh họa được tạo riêng cho bài viết này

Được dịch tự động từ bản gốc tiếng Anh.

Các nhà nghiên cứu đã giới thiệu CounterSteer, một cơ chế phòng thủ mới được thiết kế để bảo vệ các tác nhân mô hình ngôn ngữ lớn (LLM) khỏi các cuộc tấn công chèn prompt gián tiếp. Được công bố trên arXiv vào tháng 10 năm 2026, phương pháp này hoạt động ở giai đoạn suy luận bằng cách sửa đổi các trạng thái kích hoạt nội bộ của mô hình thay vì dựa vào việc lọc đầu vào hoặc giám sát đầu ra. Phương pháp này nhắm vào lỗ hổng cụ thể khi văn bản truy xuất không đáng tin cậy bị nhầm lẫn là các chỉ thị có thể thực thi bởi tác nhân.

Chuyện gì đã xảy ra

Chèn prompt gián tiếp vẫn là một lỗ hổng bảo mật nghiêm trọng đối với các tác nhân AI truy xuất và xử lý dữ liệu bên ngoài. Trong những kịch bản này, kẻ tấn công nhúng các chỉ thị độc hại vào nội dung trông có vẻ vô hại, chẳng hạn như một trang web hoặc tài liệu. Khi tác nhân truy xuất nội dung này, nó có thể tuân theo các lệnh được nhúng thay vì ý định ban đầu của người dùng, dẫn đến rò rỉ dữ liệu hoặc các hành động trái phép. Các biện pháp phòng thủ truyền thống thường gặp khó khăn trong việc phân biệt giữa nội dung hợp lệ và các chỉ thị ẩn mà không làm giảm hiệu suất chung của mô hình.

CounterSteer giải quyết vấn đề này bằng cách xác định và ức chế các đường dẫn thần kinh liên quan đến việc tuân theo các chỉ thị được nhúng. Các nhà nghiên cứu đã phát triển một quy trình gồm năm bước để khớp một hướng trong dòng dư (residual-stream direction) từ các cặp tình huống thử nghiệm. Các tình huống này chỉ khác nhau ở chỗ một chỉ thị được nhúng có được tuân theo hay bỏ qua. Bằng cách cô lập vector hướng cụ thể này trong không gian kích hoạt của mô hình, cơ chế phòng thủ có thể nhắm mục tiêu chính xác vào hành vi đó. Hướng này chỉ được giữ lại nếu nó vượt qua các cổng kiểm soát nguyên nhân và năng lực đã được xác định trước, đảm bảo rằng nó không can thiệp vào các chức năng khác của mô hình.

Việc đánh giá bao gồm năm mô hình mã nguồn mở (open-weights) có tham số từ 8 tỷ đến 106 tỷ, đại diện cho năm dòng sản phẩm khác nhau từ các nhà cung cấp. Kết quả cho thấy sự giảm mạnh mẽ trong tỷ lệ thành công của cuộc tấn công. Các mô hình không được bảo vệ có tỷ lệ thành công của cuộc tấn công từ 0,21 đến 1,00, con số này giảm xuống còn 0,00–0,17 khi bật CounterSteer. Tương tự, tỷ lệ bị xâm phạm trong benchmark AgentDojo giảm từ 0,10–0,49 xuống còn 0,006–0,079. Quan trọng hơn, lợi ích về bảo mật này đi kèm với tác động tối thiểu lên tính hữu ích thông thường, duy trì hiệu suất chuẩn hóa kiểu chữ ở mức 93–100%.

Cách thức hoạt động

CounterSteer hoạt động hoàn toàn ở giai đoạn suy luận và không yêu cầu tinh chỉnh (fine-tuning), các mô hình phụ trợ hoặc token bổ sung. Nó dựa vào phục vụ hộp trắng (white-box serving), nghĩa là bên phòng thủ có quyền truy cập vào các trạng thái nội bộ của mô hình và cần biết ranh giới phạm vi của kết quả từ công cụ. Trong giai đoạn prefill, khi mô hình xử lý ngữ cảnh được truy xuất, hệ thống sẽ trừ hướng dòng dư đã được xác định khỏi mọi token liên quan đến kết quả của công cụ. Phép trừ này triệt tiêu hiệu quả xu hướng chiếm quyền điều khiển bằng chỉ thị trước khi mô hình tạo ra phản hồi.

Vì chỉnh sửa này luôn được bật, nên không có quyết định phát hiện nào để kẻ tấn công có thể lách qua. Khác với các bộ phân loại có thể bị đánh lừa bởi các ví dụ đối kháng, phương pháp này trực tiếp thay đổi đồ thị tính toán. Các nhà nghiên cứu lưu ý rằng mặc dù cơ chế phòng thủ này vững chắc trước nhiều vectơ tấn công, nhưng nó không giải quyết được tất cả các vấn đề. Thao túng tham số, nơi kẻ tấn công chọn các đối số trong các lời gọi vốn dĩ hợp lệ, chỉ được chống lại một phần. Trong những trường hợp này, quyết định trở nên dễ đọc tuyến tính tại thời điểm phát sinh đối số nhưng không phải ở các giai đoạn sớm hơn, gợi ý rằng các biện pháp kiểm soát nguồn gốc đối số vẫn cần thiết.

Chi tiết chính

  • Cơ chế phòng thủ giảm tỷ lệ thành công của cuộc tấn công trên tập dữ liệu kiểm tra (held-out) từ 0,21–1,00 xuống còn 0,00–0,17 trên năm mô hình mã nguồn mở.
  • Tỷ lệ bị xâm phạm trong AgentDojo giảm đáng kể, từ 0,10–0,49 khi không được bảo vệ xuống còn 0,006–0,079 khi được bảo vệ.
  • Tính hữu ích thông thường vẫn ở mức cao, đạt 93–100% sau khi chuẩn hóa kiểu chữ, tránh được mức tổn thất 22–89% thấy ở các biện pháp phòng thủ khác.
  • Không cần tinh chỉnh hoặc các mô hình phụ trợ; phương pháp chỉ sử dụng phục vụ hộp trắng và ranh giới phạm vi kết quả của công cụ.
  • Tỷ lệ thành công của một kẻ tấn công thích ứng ở cấp độ benchmark giảm xuống còn khoảng một phần tư so với hiệu suất khi không được bảo vệ trên các mô hình được đánh giá sâu.
  • Các cuộc tấn công gradient hộp trắng xâm phạm tối đa 2 trong số 52 tình huống, và không có cuộc tấn công red-team do con người thực hiện nào trong số 2.052 lần phát lại thành công.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng hệ thống tác nhân, CounterSteer cung cấp một lộ trình thực tế để bảo mật các pipeline sinh tạo tăng cường truy xuất (RAG) mà không hy sinh hiệu suất. Nhiều biện pháp phòng thủ hiện có buộc phải đánh đổi giữa bảo mật và tính hữu ích, thường chặn các truy vấn hợp lệ hoặc yêu cầu huấn luyện lại tốn kém. Bằng cách hoạt động ở giai đoạn suy luận với chi phí không đáng kể cho các tác vụ thông thường, CounterSteer cho phép các nhà phát triển duy trì khả năng phản hồi cao trong khi giảm thiểu một trong những mối đe dọa dai dẳng nhất trong bảo mật AI. Điều này đặc biệt có giá trị cho các ứng dụng xử lý dữ liệu nhạy cảm, nơi các dương tính giả trong bộ lọc bảo mật có thể làm gián đoạn quy trình làm việc.

Tuy nhiên, nghiên cứu cũng nêu bật những hạn chế của các chiến lược phòng thủ hiện tại. Mặc dù CounterSteer phần lớn triệt tiêu việc chiếm quyền điều khiển bằng chỉ thị, nhưng nó không ngăn chặn hoàn toàn các cuộc tấn công thao túng tham số. Sự khác biệt này rất quan trọng đối với các kiến trúc sư hệ thống, những người phải xếp lớp nhiều biện pháp kiểm soát bảo mật. Việc chỉ dựa vào điều hướng kích hoạt (activation steering) có thể để lại lỗ hổng trong việc xác thực đối số. Các phát hiện cho thấy rằng bảo mật tác nhân vững chắc đòi hỏi sự kết hợp giữa quản lý kích hoạt nội bộ và kiểm tra nguồn gốc bên ngoài, đẩy ngành công nghiệp hướng tới các kiến trúc phòng thủ đa lớp toàn diện hơn.

Bạn có thể làm gì

  • Đánh giá xem triển khai LLM của bạn có hỗ trợ truy cập hộp trắng vào các dòng dư nội bộ hay không để tích hợp tiềm năng các kỹ thuật điều hướng kích hoạt.
  • Triển khai theo dõi ranh giới phạm vi nghiêm ngặt cho kết quả của công cụ để xác định chính xác những token nào bắt nguồn từ các nguồn bên ngoài không đáng tin cậy.
  • Xếp lớp các biện pháp kiểm soát nguồn gốc đối số cùng với các biện pháp phòng thủ kích hoạt để giảm thiểu các cuộc tấn công thao túng tham số mà việc điều hướng đơn thuần không thể ngăn chặn.
  • Kiểm tra các pipeline RAG hiện tại của bạn với các benchmark chèn prompt gián tiếp như AgentDojo để thiết lập đường cơ sở cho tỷ lệ bị xâm phạm.
  • Giám sát khả năng đọc tuyến tính của các quyết định tại các điểm phát sinh đối số để phát hiện các lỗ hổng tiềm tàng trong các biện pháp phòng thủ điều hướng trước khi tạo sinh.
  • Cân nhắc các đánh đổi giữa chỉnh sửa ở giai đoạn suy luận so với tinh chỉnh, lưu ý rằng CounterSteer tránh thay đổi trọng số nhưng yêu cầu quyền truy cập nội bộ chính xác.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết