CounterSteer bảo vệ các tác nhân LLM khỏi tấn công chèn prompt gián tiếp
Một cơ chế phòng thủ mới ở giai đoạn suy luận (inference-time) mang tên CounterSteer giúp ngăn chặn tấn công chèn prompt gián tiếp bằng cách trừ một vector kích hoạt cụ thể từ kết quả của công cụ, qua đó giảm đáng kể tỷ lệ thành công của cuộc tấn công mà không
