Seguridad y privacidad

ZeroLeaks lanza Shield Small para la detección local de inyecciones de prompts

ZeroLeaks ha lanzado Shield Small, un clasificador ligero de 118 millones de parámetros que detecta inyecciones de prompts y jailbreaks localmente en CPU.

Traducido automáticamente del original en inglés.

ZeroLeaks ha lanzado Shield Small, un clasificador compacto diseñado para detectar inyecciones de prompts e intentos de jailbreak en aplicaciones de IA. Publicado el 2 de octubre de 2026, este modelo se ejecuta completamente sin conexión en una CPU estándar, ofreciendo a los desarrolladores una forma de baja latencia para filtrar texto no confiable antes de que llegue a un agente.

Qué pasó

Shield Small es un modelo de 118 millones de parámetros basado en la arquitectura intfloat/multilingual-e5-small. Utiliza pesos ONNX int8 con un tamaño total de aproximadamente 118 MB, lo que lo hace suficientemente pequeño para desplegarse junto al código de la aplicación sin requerir hardware GPU especializado. El modelo funciona como un clasificador binario, etiquetando el texto de entrada como benigno o como un intento de inyección, y proporciona una puntuación de confianza para cada predicción.

El lanzamiento apunta a cubrir una brecha crítica en los flujos de trabajo agénticos donde los agentes procesan documentos recuperados, resultados de herramientas o mensajes de usuario que pueden contener instrucciones ocultas. Al ejecutarse localmente, el clasificador permite a las aplicaciones inspeccionar estas entradas en tiempo real. El sistema devuelve tanto un veredicto binario como una puntuación de inyección, dejando la decisión final de bloquear o revisar el contenido al desarrollador de la aplicación.

Esta versión, etiquetada como S15e, representa un esfuerzo enfocado en proporcionar una línea base no comercial para el filtrado de seguridad. Si bien el código de ejemplo está bajo licencia MIT, los pesos del modelo se publican bajo CC BY-NC 4.0, lo que significa que el uso comercial requiere una licencia separada de ZeroLeaks. Esta distinción resalta la naturaleza dual del lanzamiento: accesible para investigación y proyectos personales, pero controlado para despliegues empresariales.

Cómo funciona

El modelo opera como un codificador BERT de 12 capas con una cabeza de clasificación binaria. Procesa el texto en ventanas de 256 tokens, utilizando un paso (stride) de 192 tokens para deslizarse sobre entradas más largas. Para cualquier entrada dada, escanea hasta 32 ventanas y devuelve la puntuación de inyección más alta encontrada. Este enfoque de ventana deslizante asegura que los ataques localizados dentro de documentos más grandes no sean pasados por alto mediante promedios globales.

Al usar el ejemplo en Python proporcionado, el sistema tokeniza la entrada completa. Si el texto supera los 6.206 tokens, el clasificador revisa las primeras 28 ventanas y las últimas cuatro, omitiendo la sección central. En tales casos, el resultado incluye una marca coverage.truncated: true. Los desarrolladores deben tratar un resultado sin marcar en texto truncado como inconclusivo en lugar de seguro, ya que la parte media omitida no ha sido analizada.

La tubería de inferencia es sencilla. Después de descargar el modelo a través de Hugging Face Hub, los desarrolladores pueden inicializar la clase ShieldSmall y pasar cadenas para su clasificación. La salida incluye un estado booleano flagged y una score numérica. El umbral predeterminado para marcar es 0.5, pero la documentación recomienda ajustar este valor según el tráfico específico de la aplicación para equilibrar la sensibilidad y los falsos positivos.

Detalles clave

  • Tamaño del modelo: 118 millones de parámetros con 118 MB de pesos ONNX int8.
  • Arquitectura: Codificador BERT de 12 capas derivado de intfloat/multilingual-e5-small.
  • Rendimiento: Reporta una precisión media balanceada por categoría del 84.3% y un recall de ataque del 71.8% cuando se combina con las reglas Shield v2.
  • Manejo de entradas: Procesa ventanas de 256 tokens con un paso de 192 tokens; trunca entradas superiores a 6.206 tokens.
  • Licencia: Los pesos son CC BY-NC 4.0 (no comerciales); el código de ejemplo tiene licencia MIT.
  • Despliegue: Se ejecuta sin conexión en CPU usando Python 3.11 o 3.12.

Por qué importa

Para los ingenieros que construyen sistemas agénticos, la inyección de prompts sigue siendo una amenaza persistente que los firewalls tradicionales no pueden abordar. Estos ataques incrustan instrucciones maliciosas dentro de datos aparentemente inofensivos, como una página web recuperada o un ticket de soporte al cliente. Shield Small proporciona una capa dedicada de defensa que se sitúa entre la ingesta de datos y el procesamiento del agente, permitiendo a los equipos filtrar entradas peligrosas antes de que influyan en el comportamiento del modelo.

La capacidad de ejecutar este clasificador localmente en una CPU es significativa para el costo y la latencia. Muchas soluciones de seguridad existentes requieren llamadas API a servicios externos, lo que introduce riesgos de dependencia y posibles preocupaciones sobre la privacidad de los datos. Al mantener el proceso de filtrado interno y sin conexión, las organizaciones pueden mantener un control más estricto sobre su flujo de datos mientras añaden una sobrecarga computacional mínima a su infraestructura.

Sin embargo, la herramienta no es una solución mágica. La tasa de falsos positivos reportada del 7.2% indica que discusiones legítimas de seguridad o consultas complejas pueden ser marcadas ocasionalmente. Además, el rendimiento del modelo varía entre idiomas, ya que la mayoría de los datos de entrenamiento están en inglés. Los desarrolladores deben integrar este clasificador como parte de una estrategia de seguridad más amplia que incluya controles de acceso y políticas de herramientas, en lugar de depender de él como único mecanismo de defensa.

Qué puedes hacer

  • Descarga los pesos S15e desde Hugging Face y prueba el clasificador contra tu propio conjunto de datos de entradas de usuario.
  • Ajusta el umbral de decisión por encima o por debajo de 0.5 según tu tolerancia a los falsos positivos frente a los ataques no detectados.
  • Implementa lógica para manejar entradas truncadas rechazando o revisando manualmente textos que superen los 6.206 tokens.
  • Extrae texto plano de documentos HTML o estructurados antes de pasarlos al clasificador para asegurar una puntuación precisa.
  • Evalúa el rendimiento multilingüe del modelo si tu aplicación admite idiomas distintos al inglés, ya que la precisión puede variar.
  • Contacta a ZeroLeaks para obtener una licencia comercial si tienes la intención de desplegar Shield Small en un entorno empresarial de producción.

Herramientas de la Tienda de Bytechap

Seguir leyendo

Todos los artículos