Seguridad y privacidad

CounterSteer protege a los agentes LLM contra la inyección indirecta de prompts

Una nueva defensa en tiempo de inferencia llamada CounterSteer suprime la inyección indirecta de prompts restando un vector de activación específico de los resultados de las herramientas, reduciendo significativamente las tasas de éxito de los ataques sin

Ilustración de la orientación de activaciones eliminando un vector malicioso del estado interno de un modelo.
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Los investigadores han presentado CounterSteer, un nuevo mecanismo de defensa diseñado para proteger a los agentes de modelos de lenguaje grandes (LLM) contra ataques de inyección indirecta de prompts. Publicado en arXiv en octubre de 2026, este enfoque opera en tiempo de inferencia modificando las activaciones internas del modelo, en lugar de depender del filtrado de entradas o el monitoreo de salidas. El método apunta a la vulnerabilidad específica donde el texto recuperado no confiable es tratado erróneamente como instrucciones ejecutables por parte del agente.

Qué ocurrió

La inyección indirecta de prompts sigue siendo una falla de seguridad crítica para los agentes de IA que recuperan y procesan datos externos. En estos escenarios, un atacante incrusta instrucciones maliciosas dentro de contenido aparentemente benigno, como una página web o un documento. Cuando el agente recupera este contenido, puede seguir los comandos incrustados en lugar de la intención original del usuario, lo que conduce a fugas de datos o acciones no autorizadas. Las defensas tradicionales a menudo tienen dificultades para distinguir entre contenido legítimo e instrucciones ocultas sin degradar el rendimiento general del modelo.

CounterSteer aborda esto identificando y suprimiendo las rutas neuronales asociadas con seguir instrucciones incrustadas. Los investigadores desarrollaron una receta de cinco pasos para ajustar una dirección de flujo residual a partir de episodios emparejados. Estos episodios difieren solo en si se sigue o se ignora una instrucción incrustada. Al aislar este vector direccional específico en el espacio de activación del modelo, la defensa puede apuntar al comportamiento con precisión. La dirección se conserva solo si pasa por las puertas causales y de capacidad preespecificadas, asegurando que no interfiera con otras funciones del modelo.

La evaluación abarcó cinco modelos de pesos abiertos que van desde 8 mil millones hasta 106 mil millones de parámetros, representando cinco linajes de proveedores diferentes. Los resultados mostraron una reducción dramática en el éxito de los ataques. Los modelos sin defensa tenían tasas de éxito de ataque entre 0,21 y 1,00, que cayeron a 0,00-0,17 con CounterSteer habilitado. De manera similar, la tasa de compromiso en el benchmark AgentDojo cayó de 0,10-0,49 a 0,006-0,079. Crucialmente, esta ganancia en seguridad vino con un impacto mínimo en la utilidad benigna, manteniendo un rendimiento normalizado tipográficamente del 93-100%.

Cómo funciona

CounterSteer opera completamente en tiempo de inferencia y no requiere ajuste fino, modelos auxiliares ni tokens adicionales. Depende del servicio de caja blanca, lo que significa que el defensor tiene acceso a los estados internos del modelo, y requiere conocimiento de los límites de rango de los resultados de las herramientas. Durante la fase de prellenado, cuando el modelo procesa el contexto recuperado, el sistema resta la dirección de flujo residual identificada de cada token asociado con los resultados de las herramientas. Esta resta neutraliza efectivamente la tendencia al secuestro instruccional antes de que el modelo genere una respuesta.

Dado que la edición está siempre activa, no hay una decisión de detección que un atacante pueda evadir. A diferencia de los clasificadores que podrían ser engañados por ejemplos adversarios, este método altera directamente el grafo de cómputo. Los investigadores señalaron que, aunque la defensa es robusta contra muchos vectores de ataque, no resuelve todos los problemas. La manipulación de parámetros, donde los atacantes eligen argumentos en llamadas por lo demás legítimas, solo se resiste parcialmente. En estos casos, la decisión se vuelve linealmente legible en la emisión de argumentos, pero no en etapas anteriores, lo que sugiere que aún son necesarios controles de procedencia de argumentos.

Detalles clave

  • La defensa reduce las tasas de éxito de ataques de prueba retenida de 0,21-1,00 a 0,00-0,17 en cinco modelos de pesos abiertos.
  • Las tasas de compromiso de AgentDojo caen significativamente, de 0,10-0,49 sin defensa a 0,006-0,079 con defensa.
  • La utilidad benigna permanece alta en un 93-100% normalizada tipográficamente, evitando la pérdida del 22-89% vista en otras defensas.
  • No se requieren ajuste fino ni modelos auxiliares; el método utiliza solo servicio de caja blanca y límites de rango de resultados de herramientas.
  • La tasa de éxito de un atacante adaptativo a nivel de benchmark se reduce aproximadamente a una cuarta parte de su rendimiento sin defensa en modelos evaluados profundamente.
  • Los ataques de gradiente de caja blanca comprometen como máximo 2 de 52 episodios, y ninguno de los 2.052 ataques de red team humano reproducidos tiene éxito.

Por qué importa

Para los ingenieros que construyen sistemas agénticos, CounterSteer ofrece una ruta práctica para asegurar las tuberías de generación aumentada por recuperación (RAG) sin sacrificar el rendimiento. Muchas defensas existentes fuerzan un intercambio entre seguridad y utilidad, bloqueando a menudo consultas legítimas o requiriendo reentrenamientos costosos. Al operar en tiempo de inferencia con una sobrecarga insignificante en tareas benignas, CounterSteer permite a los desarrolladores mantener una alta capacidad de respuesta mientras mitigan una de las amenazas más persistentes en la seguridad de la IA. Esto es particularmente valioso para aplicaciones que manejan datos sensibles donde los falsos positivos en los filtros de seguridad pueden interrumpir los flujos de trabajo.

Sin embargo, la investigación también destaca los límites de las estrategias defensivas actuales. Aunque CounterSteer neutraliza en gran medida el secuestro instruccional, no previene completamente los ataques de manipulación de parámetros. Esta distinción es crucial para los arquitectos de sistemas que deben superponer múltiples controles de seguridad. Confiar únicamente en la orientación de activaciones puede dejar brechas en la validación de argumentos. Los hallazgos sugieren que una seguridad robusta para agentes requiere una combinación de gestión interna de activaciones y verificaciones externas de procedencia, impulsando a la industria hacia arquitecturas de defensa más integrales y multinivel.

Qué puedes hacer

  • Evalúa si tu despliegue de LLM soporta acceso de caja blanca a los flujos residuales internos para una posible integración de técnicas de orientación de activaciones.
  • Implementa un seguimiento estricto de los límites de rango para los resultados de herramientas para identificar exactamente qué tokens provienen de fuentes externas no confiables.
  • Superpón controles de procedencia de argumentos junto con defensas de activación para mitigar ataques de manipulación de parámetros que la orientación sola no puede detener.
  • Prueba tus tuberías RAG actuales contra benchmarks de inyección indirecta de prompts como AgentDojo para establecer una línea base de tasas de compromiso.
  • Monitorea la legibilidad lineal de las decisiones en los sitios de emisión de argumentos para detectar posibles evasiones de las defensas de orientación pre-generación.
  • Considera los intercambios entre ediciones en tiempo de inferencia frente al ajuste fino, notando que CounterSteer evita cambios en los pesos pero requiere acceso interno preciso.

Herramientas de la Tienda de Bytechap

Seguir leyendo

Todos los artículos