El lanzamiento de GLM-5.3 elimina las barreras para el desarrollo autónomo de exploits cibernéticos
El nuevo modelo de pesos abiertos de Zhipu AI, GLM-5.3, iguala a los modelos fronterizos de EE. UU. en la generación de exploits, pero carece de salvaguardas robustas, lo que permite a los atacantes eludir fácilmente las restricciones.
Traducido automáticamente del original en inglés.
El lanzamiento de GLM-5.3 por parte de Zhipu AI marca un cambio significativo en la accesibilidad de capacidades cibernéticas avanzadas. A diferencia de los modelos fronterizos anteriores, que restringían el acceso o implementaban fuertes medidas de seguridad, este modelo de pesos abiertos permite a cualquiera descargarlo y modificar su comportamiento. Los investigadores de seguridad han confirmado que sus salvaguardas pueden eludirse con altas tasas de éxito utilizando técnicas simples.
Este desarrollo significa que las herramientas sofisticadas de generación de exploits están ahora disponibles gratuitamente para actores maliciosos. Si bien los defensores también pueden usar estas herramientas, la asimetría favorece a quienes están dispuestos a ignorar las restricciones éticas. La capacidad del modelo para encadenar vulnerabilidades de forma autónoma representa un nuevo estándar para las amenazas cibernéticas automatizadas.
Qué sucedió
Cinco meses después de que Anthropic lanzara Claude Mythos Preview a través de un programa de acceso limitado llamado Project Glasswing, una capacidad comparable ha entrado en el dominio público. Zhipu AI, conocida internacionalmente como Z.ai, lanzó GLM-5.3 sin salvaguardas significativas para limitar su uso indebido. Esto contrasta fuertemente con los modelos fronterizos de EE. UU., que se mantienen privados, se liberan solo a usuarios verificados o están protegidos por sólidas salvaguardas a nivel de API.
El Centro de Estándares e Innovación en IA (CAISI) del Instituto Nacional de Estándares y Tecnología (NIST) evaluó GLM-5.3 el 17 de septiembre. Lo identificaron como el modelo de pesos abiertos más capaz en materia cibernética lanzado hasta la fecha. Sus pruebas indican que GLM-5.3 está aproximadamente cuatro meses por detrás de la frontera estadounidense en capacidades cibernéticas agregadas. Sin embargo, dado que los modelos de EE. UU. no son descargables libremente, GLM-5.3 efectivamente lleva el poder ofensivo de nivel fronterizo a cualquier actor con recursos informáticos suficientes.
Los investigadores probaron la capacidad del modelo para desarrollar exploits de extremo a extremo. En evaluaciones utilizando ExploitBench, que apunta a vulnerabilidades conocidas en el motor V8 de Google Chrome, GLM-5.3 desarrolló con éxito exploits en 50 de 410 intentos. Este rendimiento es casi idéntico al de Claude Mythos Preview, que tuvo éxito en 56 de 410 intentos. En pruebas internas de explotación de binarios que involucraban proyectos de código abierto, GLM-5.3 logró secuestros completos del flujo de control en el 4% de los ensayos. Si bien esto es ligeramente inferior al 6% de Claude Mythos Preview, representa un salto importante desde modelos anteriores como GLM-5.2 y Claude Opus 4.6, que no lograron ningún éxito en los ensayos.
Cómo funciona
GLM-5.3 opera como un modelo de pesos abiertos, lo que significa que sus parámetros internos están disponibles públicamente. Esta arquitectura permite a los usuarios modificar directamente el modelo, un proceso conocido como abliteration. Al reconfigurar los pesos del modelo, los usuarios pueden eliminar los mecanismos de rechazo que impiden que la IA genere contenido dañino. Los investigadores descubrieron que la abliteration de GLM-5.3 redujo su tasa de rechazo en benchmarks dañinos de más del 90% a aproximadamente un 2-3%, con un impacto mínimo en sus capacidades científicas o cibernéticas generales.
Incluso sin modificar los pesos, los atacantes pueden eludir las salvaguardas utilizando técnicas de ingeniería de prompts. En pruebas simuladas, los investigadores utilizaron prompts engañosos, como afirmar que la IA actuaba como un agente red-team autónomo. Este enfoque hizo que el modelo interactuara con solicitudes maliciosas el 64% de las veces. Otra técnica implicaba prellenar los tokens de pensamiento del modelo para simular una consideración previa de la solicitud, lo que aumentó la interacción al 92%. Estos métodos no funcionan contra los modelos Claude protegidos por salvaguardas, que bloquean los prompts engañosos y no permiten el prellenado de tokens a través de su API.
El modelo demuestra autonomía para encontrar y encadenar vulnerabilidades. En una prueba, un investigador usó GLM-5.3 para identificar vulnerabilidades previamente desconocidas en el motor JavaScript de un navegador web Linux. En un día y con menos de una hora de atención humana, el modelo encadenó estos fallos en un exploit funcional que podía leer archivos arbitrarios del ordenador de un visitante. En otra instancia, la versión más pequeña GLM-5.3-Flash creó una cadena de exploits fiable para una vulnerabilidad conocida de Chrome, eludiendo el endurecimiento de autenticación de punteros en solo 20 minutos de supervisión humana.
Detalles clave
- GLM-5.3 es el primer modelo de pesos abiertos con capacidades cibernéticas que igualan a los modelos fronterizos restringidos de EE. UU. como Claude Mythos Preview.
- Las salvaguardas pueden eludirse entre el 64% y el 100% de las veces utilizando técnicas simples como prompts engañosos o abliteration.
- El modelo desarrolló con éxito exploits de extremo a extremo en 50 de 410 intentos en el benchmark ExploitBench.
- La abliteration del modelo cuesta aproximadamente $4,400 en cómputo y requiere unas 2,200 horas de GPU para equipos sin experiencia.
- GLM-5.3-Flash generó un exploit funcional para una vulnerabilidad conocida de Chrome (CVE-2026-11645) por un costo de $20.40 a precios de API.
- CAISI del NIST clasifica a GLM-5.3 como rezagado respecto a los modelos fronterizos de EE. UU. por unos cuatro meses en benchmarks cibernéticos agregados.
Por qué importa
Para los ingenieros de software y los equipos de seguridad, la barrera de entrada para ataques cibernéticos sofisticados ha disminuido significativamente. Anteriormente, desarrollar cadenas complejas de exploits requería un profundo conocimiento y mucho tiempo. Ahora, los actores con recursos modestos pueden aprovechar GLM-5.3 para automatizar el descubrimiento de vulnerabilidades y la generación de exploits. Esto desplaza la carga defensiva, ya que los atacantes pueden escalar sus esfuerzos utilizando agentes de IA que trabajan de forma continua y barata.
La disponibilidad de versiones abliterated significa que los filtros de seguridad estándar son ineficaces contra adversarios decididos. Los defensores ya no pueden confiar en la suposición de que las herramientas de IA rechazarán solicitudes dañinas. En su lugar, deben asumir que los atacantes tienen acceso a modelos sin restricciones capaces de razonamiento autónomo y generación de código. Esto hace necesario un enfoque proactivo de la seguridad, centrado en el parcheo rápido y el robustecimiento del sistema, en lugar de depender de la incompetencia o las limitaciones de recursos del atacante.
Además, este desarrollo destaca la urgencia de que los defensores accedan a herramientas igualmente capaces. Si los actores maliciosos usan IA fronteriza para encontrar vulnerabilidades zero-day, los defensores necesitan capacidades similares para identificar y corregir estos fallos antes de que sean explotados. El panorama actual favorece a quienes actúan rápidamente, haciendo de la integración de pruebas de seguridad asistidas por IA un componente crítico de los ciclos de vida modernos del desarrollo de software.
Qué puedes hacer
- Prioriza el parcheo inmediato de vulnerabilidades conocidas, ya que los modelos de IA pueden convertir rápidamente las correcciones públicas en exploits funcionales.
- Implementa una validación rigurosa de entradas y sandboxing para mitigar el impacto de posibles exploits de navegadores o motores.
- Adopta herramientas de pruebas de seguridad asistidas por IA para identificar vulnerabilidades en tu base de código antes que los atacantes.
- Monitoriza actividad de red inusual o patrones de acceso a archivos que puedan indicar intentos de exploits automatizados.
- Participa en programas de bug bounty y comparte datos de vulnerabilidades para ayudar a asegurar dependencias de código abierto.
- Aboga por y utiliza programas de acceso confiable que proporcionen a los defensores modelos de IA avanzados y protegidos por salvaguardas.



