Benchmark của Red Hat cho thấy các bộ phân loại nhỏ có thể sánh ngang LLM lớn trong việc phát hiện tấn công prompt injection
Theo các benchmark mới từ Red Hat, một mô hình chỉ với 200 triệu tham số đã đạt độ chính xác tương đương với một LLM 35 tỷ tham số khi làm nhiệm vụ đánh giá (judge) về prompt injection, đồng thời chạy nhanh hơn đáng kể.
Được dịch tự động từ bản gốc tiếng Anh.
Đội ngũ AI Safety của Red Hat vừa công bố kết quả benchmark so sánh ba phương pháp tiếp cận khác nhau đối với các rào chắn an toàn AI (AI guardrails): bộ phân loại chuyên dụng, trọng tài dựa trên mô hình ngôn ngữ lớn (LLM judge), và mô hình ra quyết định zero-shot. Các bài kiểm tra, được thực hiện vào cuối năm 2026, tiết lộ rằng một bộ phân loại gọn nhẹ với chỉ 200 triệu tham số có thể đạt độ chính xác gần như tương đương với một mô hình khổng lồ 35 tỷ tham số khi phát hiện prompt injection, nhưng với độ trễ thấp hơn rất nhiều.
Chuyện gì đã xảy ra
Cuộc đánh giá tập trung vào chín cấu hình rào chắn khác nhau, được thử nghiệm chống lại hai nhóm rủi ro chính: prompt injection và an toàn nội dung. Red Hat đã sử dụng bộ công cụ mã nguồn mở NeMo Guardrails của NVIDIA để chuẩn hóa môi trường kiểm thử. Các ứng viên bao gồm Qwen3.6-35B đóng vai trò là LLM judge, mô hình ra quyết định Jev của TypeSafe, cùng một số bộ phân loại nhỏ hơn như mô hình dựa trên DeBERTa và Granite Guardian của riêng Red Hat.
Trong hạng mục prompt injection, kết quả khá sít sao. Qwen3.6-35B đạt độ chính xác cao nhất ở mức 89,31%, nhưng bộ phân loại dựa trên DeBERTa xếp thứ hai sát nút với 89,01%. Bất chấp sự chênh lệch không đáng kể về độ chính xác, khoảng cách hiệu năng lại rất lớn. Bộ phân loại nhỏ trả về quyết định trong thời gian trung vị là 54,1 mili giây, trong khi Qwen mất tới 312,5 mili giây. Jev, mô hình ra quyết định, tụt hậu cả về độ chính xác (86,35%) lẫn tốc độ (348,1 mili giây).
Bảng xếp hạng đảo ngược đối với các kiểm tra an toàn nội dung, vốn bao quát phạm vi rủi ro rộng hơn bao gồm định kiến, bạo lực và hoạt động bất hợp pháp. Tại đây, Jev dẫn đầu với độ chính xác 86,20%, theo sát bởi DiffusionGemma, một giải pháp mã nguồn mở, với 85,53%. Qwen xếp thứ ba với 85,47%. Bộ phân loại Granite Guardian của Red Hat hoàn thành ở vị trí thứ sáu với độ chính xác 80,27%, mặc dù nó vẫn là lựa chọn nhanh nhất ở mức 33,2 mili giây. Những kết quả này cho thấy trong khi các bộ phân loại nhỏ vượt trội trong các tác vụ cụ thể, được xác định rõ ràng như phát hiện injection, chúng vẫn kém hơn các mô hình linh hoạt hơn trong việc kiểm duyệt nội dung phức tạp.
Cách thức hoạt động
Ba phương pháp tiếp cận khác nhau cơ bản về cách chúng xử lý đầu vào. Các bộ phân loại chuyên dụng được huấn luyện trên các tập dữ liệu có nhãn để nhận diện các mẫu cụ thể. Chúng xuất ra một điểm xác suất đơn giản, khiến chúng rẻ về mặt tính toán và nhanh chóng. Ngược lại, các LLM judge như Qwen tạo ra văn bản để suy luận về mức độ an toàn của một prompt, điều này đòi hỏi tài nguyên tính toán và thời gian đáng kể. Các mô hình ra quyết định như Jev nằm ở khoảng giữa. Chúng chấp nhận các câu hỏi có kiểu dữ liệu (typed questions) về trạng thái ứng dụng và trả về các câu trả lời có kiểu dữ liệu (typed answers), chẳng hạn như xác suất, mà không cần tạo ra các token văn bản đầy đủ. Khả năng zero-shot này cho phép chúng thích nghi với các chính sách mới mà không cần huấn luyện lại, mang lại sự linh hoạt gần giống LLM nhưng với định dạng đầu ra có cấu trúc.
Tuy nhiên, benchmark nhấn mạnh rằng kiến trúc triển khai ảnh hưởng lớn đến hiệu năng cảm nhận được. Red Hat đã chạy các bộ phân loại nhỏ cục bộ trên CPU của MacBook Pro M1. Các mô hình lớn hơn, bao gồm Qwen và DiffusionGemma, chạy trên các node GPU với 96 GB VRAM trong một cụm điện toán đám mây. Vì các bài kiểm tra bắt nguồn từ Vương quốc Anh, mỗi yêu cầu gửi tới các mô hình được lưu trữ trên đám mây đều phải chịu một bước nhảy mạng xuyên Đại Tây Dương. Red Hat ước tính điều này thêm ít nhất 56 mili giây cho mỗi yêu cầu. Ngay cả sau khi trừ đi độ trễ mạng này, các mô hình dựa trên đám mây vẫn chậm hơn đáng kể so với các bộ phân loại cục bộ, chứng minh rằng lợi thế tốc độ của các mô hình nhỏ không chỉ là sản phẩm phụ của vị trí mạng gần gũi.
Chi tiết quan trọng
- Qwen3.6-35B đạt độ chính xác 89,31% trên prompt injection, trong khi bộ phân loại DeBERTa với 200 triệu tham số đạt 89,01%.
- Bộ phân loại DeBERTa có độ trễ trung vị là 54,1 mili giây, so với 312,5 mili giây của Qwen và 348,1 mili giây của Jev.
- Jev dẫn đầu benchmark an toàn nội dung với độ chính xác 86,20%, vượt qua Qwen (85,47%) và Granite Guardian (80,27%).
- DiffusionGemma, một mô hình ra quyết định mã nguồn mở, đạt độ chính xác 85,53% về an toàn nội dung và đánh bại Jev trong prompt injection với 87,72%.
- Kỹ thuật prompt engineering tác động đáng kể đến kết quả; việc tinh chỉnh các chính sách cho mô hình Laya đã cải thiện điểm an toàn nội dung của nó từ 57,87% lên 75,20%.
- Red Hat dự kiến sẽ cung cấp cả hai bộ phân loại DeBERTa và Granite Guardian dưới dạng cấu hình rào chắn mặc định trong OpenShift AI 3.6.
Tại sao điều này quan trọng
Đối với các kỹ sư xây dựng ứng dụng AI trong môi trường sản xuất, những phát hiện này thách thức giả định rằng các mô hình lớn luôn cần thiết cho sự an toàn vững chắc. Nếu một rủi ro cụ thể như prompt injection có thể được xử lý bởi một bộ phân loại tí hon chạy trên phần cứng phổ thông, các đội ngũ có thể tránh được chi phí và độ phức tạp khi quản lý các cụm GPU lớn hoặc phụ thuộc vào API của bên thứ ba cho mọi yêu cầu. Sự chuyển dịch này cho phép các rào chắn an toàn, độ trễ thấp chạy trực tiếp trong hạ tầng của ứng dụng, giảm thiểu các điểm lỗi và gánh nặng vận hành.
Tuy nhiên, kết quả cũng nhấn mạnh rằng không có giải pháp nào phù hợp với tất cả các nhu cầu an toàn. Trong khi các bộ phân loại nhỏ chiếm ưu thế về tốc độ và các tác vụ cụ thể, chúng gặp khó khăn với sự tinh tế cần thiết cho các chính sách an toàn nội dung rộng rãi. Các mô hình ra quyết định cung cấp một giải pháp trung gian hấp dẫn cho các kịch bản zero-shot nhưng không liên tục vượt trội hơn bất kỳ cực nào. Các nhà phát triển phải cẩn thận ghép loại rào chắn với hồ sơ rủi ro cụ thể, nhận thức rằng thiết kế prompt và tinh chỉnh chính sách vẫn là những yếu tố then chốt bất kể kiến trúc mô hình nền tảng.
Bạn có thể làm gì
- Đánh giá các bộ phân loại chuyên dụng cho những rủi ro được xác định rõ như prompt injection khi có sẵn dữ liệu huấn luyện có nhãn.
- Sử dụng các mô hình ra quyết định hoặc LLM judge cho các chính sách an toàn nội dung rộng hơn, nơi cần sự linh hoạt và khả năng zero-shot.
- Tính đến độ trễ mạng khi benchmark các rào chắn được lưu trữ trên đám mây so với các rào chắn cục bộ.
- Cân nhắc kỹ lưỡng giữa độ chính xác và độ trễ tùy thuộc vào yêu cầu kinh doanh cụ thể của bạn.



