CounterSteer defends LLM agents against indirect prompt injection
A new inference-time defense called CounterSteer suppresses indirect prompt injection by subtracting a specific activation vector from tool results, reducing attack success rates significantly without
