Bảo mật & quyền riêng tư

ZeroLeaks ra mắt Shield Small để phát hiện tấn công chèn prompt cục bộ

ZeroLeaks đã phát hành Shield Small, một bộ phân loại nhẹ với 118 triệu tham số, có khả năng phát hiện các cuộc tấn công chèn prompt và jailbreak trực tiếp trên CPU.

Được dịch tự động từ bản gốc tiếng Anh.

ZeroLeaks đã phát hành Shield Small, một bộ phân loại nhỏ gọn được thiết kế để phát hiện các cuộc tấn công chèn prompt và nỗ lực jailbreak trong các ứng dụng AI. Được công bố vào ngày 2 tháng 10 năm 2026, mô hình này chạy hoàn toàn ngoại tuyến trên CPU tiêu chuẩn, cung cấp cho các nhà phát triển một phương pháp sàng lọc văn bản không đáng tin cậy với độ trễ thấp trước khi chúng đến tay agent.

Điều gì đã xảy ra

Shield Small là một mô hình gồm 118 triệu tham số dựa trên kiến trúc intfloat/multilingual-e5-small. Nó sử dụng trọng số ONNX int8 với tổng dung lượng khoảng 118 MB, đủ nhỏ để triển khai cùng với mã ứng dụng mà không cần phần cứng GPU chuyên dụng. Mô hình hoạt động như một bộ phân loại nhị phân, gắn nhãn văn bản đầu vào là vô hại hoặc là một nỗ lực tấn công chèn, đồng thời cung cấp điểm tin cậy cho mỗi dự đoán.

Bản phát hành này nhắm vào một lỗ hổng quan trọng trong quy trình làm việc của agent, nơi các agent xử lý tài liệu truy xuất, kết quả từ công cụ hoặc tin nhắn người dùng có thể chứa các chỉ thị ẩn. Bằng cách chạy cục bộ, bộ phân loại cho phép các ứng dụng kiểm tra những đầu vào này theo thời gian thực. Hệ thống trả về cả phán quyết nhị phân và điểm tấn công chèn, để lại quyết định cuối cùng về việc chặn hoặc xem xét nội dung cho nhà phát triển ứng dụng.

Phiên bản này, được dán nhãn S15e, đại diện cho nỗ lực tập trung nhằm cung cấp một cơ sở phi thương mại cho việc sàng lọc bảo mật. Trong khi mã ví dụ được cấp phép MIT, chính các trọng số mô hình được phát hành theo giấy phép CC BY-NC 4.0, nghĩa là việc sử dụng thương mại yêu cầu một giấy phép riêng từ ZeroLeaks. Sự khác biệt này nhấn mạnh tính chất kép của bản phát hành: dễ tiếp cận cho nghiên cứu và các dự án cá nhân, nhưng được kiểm soát chặt chẽ đối với triển khai doanh nghiệp.

Cách thức hoạt động

Mô hình hoạt động như một bộ mã hóa BERT 12 lớp với một đầu phân loại nhị phân. Nó xử lý văn bản trong các cửa sổ 256 token, sử dụng bước nhảy (stride) 192 token để trượt qua các đầu vào dài hơn. Đối với bất kỳ đầu vào nào, nó quét tối đa 32 cửa sổ và trả về điểm tấn công chèn cao nhất tìm thấy. Phương pháp cửa sổ trượt này đảm bảo rằng các cuộc tấn công cục bộ trong các tài liệu lớn không bị bỏ sót do việc lấy trung bình toàn cục.

Khi sử dụng ví dụ Python được cung cấp, hệ thống sẽ token hóa toàn bộ đầu vào. Nếu văn bản vượt quá 6.206 token, bộ phân loại sẽ kiểm tra 28 cửa sổ đầu tiên và bốn cửa sổ cuối cùng, bỏ qua phần giữa. Trong những trường hợp như vậy, kết quả bao gồm cờ coverage.truncated: true. Các nhà phát triển phải coi kết quả không có cờ trên văn bản bị cắt ngắn là không chắc chắn thay vì an toàn, vì phần giữa bị bỏ qua chưa được phân tích.

Quy trình suy luận khá đơn giản. Sau khi tải mô hình thông qua Hugging Face Hub, các nhà phát triển có thể khởi tạo lớp ShieldSmall và truyền chuỗi để phân loại. Đầu ra bao gồm trạng thái boolean flagged và điểm số dạng số score. Ngưỡng mặc định để gắn cờ là 0.5, nhưng tài liệu khuyên nên điều chỉnh giá trị này dựa trên lưu lượng truy cập cụ thể của ứng dụng để cân bằng giữa độ nhạy và cảnh báo giả.

Chi tiết chính

  • Kích thước mô hình: 118 triệu tham số với 118 MB trọng số ONNX int8.
  • Kiến trúc: Bộ mã hóa BERT 12 lớp bắt nguồn từ intfloat/multilingual-e5-small.
  • Hiệu suất: Báo cáo độ chính xác cân bằng danh mục trung bình 84,3% và tỷ lệ thu hồi tấn công 71,8% khi kết hợp với Shield rules v2.
  • Xử lý đầu vào: Xử lý các cửa sổ 256 token với bước nhảy 192 token; cắt ngắn các đầu vào vượt quá 6.206 token.
  • Giấy phép: Trọng số theo CC BY-NC 4.0 (phi thương mại); mã ví dụ được cấp phép MIT.
  • Triển khai: Chạy ngoại tuyến trên CPU sử dụng Python 3.11 hoặc 3.12.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng hệ thống agent, tấn công chèn prompt vẫn là một mối đe dọa dai dẳng mà tường lửa truyền thống không thể giải quyết. Những cuộc tấn công này nhúng các chỉ thị độc hại vào dữ liệu trông có vẻ vô hại, chẳng hạn như một trang web được truy xuất hoặc một vé hỗ trợ khách hàng. Shield Small cung cấp một lớp phòng thủ chuyên dụng nằm giữa việc tiếp nhận dữ liệu và xử lý của agent, cho phép các nhóm lọc bỏ những đầu vào nguy hiểm trước khi chúng ảnh hưởng đến hành vi của mô hình.

Khả năng chạy bộ phân loại này cục bộ trên CPU rất quan trọng đối với chi phí và độ trễ. Nhiều giải pháp bảo mật hiện có yêu cầu gọi API tới các dịch vụ bên ngoài, điều này gây ra rủi ro phụ thuộc và lo ngại tiềm tàng về quyền riêng tư dữ liệu. Bằng cách giữ quy trình sàng lọc ở nội bộ và ngoại tuyến, các tổ chức có thể duy trì sự kiểm soát nghiêm ngặt hơn đối với luồng dữ liệu của họ trong khi thêm gánh nặng tính toán tối thiểu cho hạ tầng của mình.

Tuy nhiên, công cụ này không phải là viên đạn bạc. Tỷ lệ dương tính giả được báo cáo là 7,2% cho thấy các cuộc thảo luận bảo mật hợp pháp hoặc các truy vấn phức tạp đôi khi có thể bị gắn cờ. Hơn nữa, hiệu suất của mô hình thay đổi tùy theo ngôn ngữ, vì hầu hết dữ liệu huấn luyện là tiếng Anh. Các nhà phát triển phải tích hợp bộ phân loại này như một phần của chiến lược bảo mật rộng lớn hơn bao gồm kiểm soát truy cập và chính sách công cụ, thay vì dựa vào nó như cơ chế phòng thủ duy nhất.

Bạn có thể làm gì

  • Tải trọng số S15e từ Hugging Face và thử nghiệm bộ phân loại với tập dữ liệu đầu vào người dùng của riêng bạn.
  • Điều chỉnh ngưỡng quyết định trên hoặc dưới 0.5 dựa trên mức độ chấp nhận dương tính giả so với bỏ sót tấn công của bạn.
  • Triển khai logic để xử lý các đầu vào bị cắt ngắn bằng cách từ chối hoặc xem xét thủ công các văn bản vượt quá 6.206 token.
  • Trích xuất văn bản thuần túy từ HTML hoặc tài liệu có cấu trúc trước khi chuyển chúng cho bộ phân loại để đảm bảo chấm điểm chính xác.
  • Đánh giá hiệu suất đa ngôn ngữ của mô hình nếu ứng dụng của bạn hỗ trợ nhiều ngôn ngữ.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết