Anthropic redirige las solicitudes cibernéticas de alto riesgo desde Sonnet 5.5 a modelos anteriores
El nuevo modelo Sonnet 5.5 de Anthropic utiliza un enrutamiento basado en clasificadores para recurrir a Sonnet 5 en tareas de ciberseguridad de alto riesgo, lo que requiere que los desarrolladores de API activen esta opción.
Traducido automáticamente del original en inglés.
Anthropic lanzó Claude Sonnet 5.5 el lunes 29 de septiembre de 2026, introduciendo salvaguardas cibernéticas y cambios automáticos de modelo que antes estaban reservados para sus modelos de gama alta. Esta actualización marca un cambio en la forma en que la empresa gestiona la seguridad para cargas de trabajo de producción de gama media, enfocándose específicamente en las capacidades de seguridad ofensiva.
Qué ocurrió
Sonnet 5.5 es el primer modelo de la serie Sonnet que se lanza con salvaguardas cibernéticas integradas y enrutamiento basado en clasificadores. Aunque Anthropic afirma que este lanzamiento no avanza la frontera general de las capacidades del modelo, califica las habilidades de ciberseguridad de Sonnet 5.5 como comparables a las de Opus 5. En la prueba de referencia de codificación agéntica Terminal-Bench 4.0, el modelo más económico obtuvo una puntuación del 70,6%, superando a Opus 5.5 en su configuración de esfuerzo xhigh, que logró un 66,4%.
La decisión de implementar estas salvaguardas surge de mejoras significativas en el rendimiento de seguridad ofensiva del modelo. Con las salvaguardas desactivadas durante las pruebas, Sonnet 5.5 logró la ejecución arbitraria de código completo en 178 de 410 ejecuciones de ExploitBench. También completó el 46,1% de los desafíos en CyScenarioBench de Irregular, un aumento drástico respecto a la tasa de finalización del 0,7% de Sonnet 5. Además, gestionó 50 secuestros de flujo de control en una prueba de explotación binaria basada en el corpus OSS-Fuzz de Google, frente a solo tres de su predecesor.
Aunque Anthropic considera que Sonnet 5.5 es menos capaz que Opus 5.5 o Mythos 5.1 en ciberseguridad, el salto en capacidad fue suficiente para justificar la misma política cibernética aplicada a los modelos de gama alta. La empresa reconoce que estas intervenciones probablemente reduzcan las puntuaciones de las pruebas cuando las salvaguardas están activas, pero son necesarias para mitigar los riesgos asociados con la generación de exploits y las pruebas de penetración.
Cómo funciona
El mecanismo de aplicación opera en tres etapas. Primero, una sonda lee las activaciones internas del modelo. Segundo, un clasificador ligero que se ejecuta en Sonnet 5.5 evalúa la solicitud. Finalmente, un clasificador de lenguaje natural entrenado por separado pondera el veredicto de la sonda para decidir si bloquear la conversación. Anthropic afirma que estos clasificadores detectan solicitudes cibernéticas dañinas a tasas comparables a las de Opus 5, aunque las protecciones contra jailbreaks son menos agresivas porque Sonnet 5.5 no es tan capaz como los modelos de gama alta.
Cuando una solicitud se marca como de alto riesgo, como aquellas que involucran pruebas de penetración, generación de exploits o escaneo de vulnerabilidades binarias, el sistema activa un recurso alternativo. Para los usuarios de API que han optado por esta función, la solicitud se enruta visiblemente a Sonnet 5. En las propias aplicaciones de Anthropic, los usuarios ven una notificación cuando ocurre el cambio, y la respuesta identifica el modelo utilizado. Si el recurso alternativo no está habilitado, la solicitud simplemente se detiene en lugar de pasarse al modelo anterior.
Es importante destacar que los bloqueos por biología, armas convencionales y anti-destilación no activan un recurso alternativo; terminan la solicitud por completo. Estos bloqueos son transparentes y no alteran encubiertamente las respuestas. Sin embargo, la política cibernética permite el descubrimiento de vulnerabilidades en el código fuente para apoyar flujos de trabajo de codificación segura, mientras bloquea dicho descubrimiento en binarios compilados.
Detalles clave
- Sonnet 5.5 se lanzó el lunes 29 de septiembre de 2026, con salvaguardas cibernéticas y recursos alternativos de modelo.
- Las solicitudes de ciberseguridad de alto riesgo pueden recurrir a Sonnet 5 si los desarrolladores de API activan el recurso automático.
- El modelo obtuvo un 70,6% en Terminal-Bench 4.0, superando el 66,6% de Opus 5.5 en esfuerzo xhigh.
- Las salvaguardas revisan todo el contenido de entrada, incluida la memoria, el contenido de conectores, los resultados de búsqueda web y los archivos.
- Las pruebas de inyección de prompts mostraron que el 12,01% de las solicitudes reenviadas a Sonnet 5 fueron comprometidas con éxito.
- Los defensores verificados podrían acceder eventualmente al modelo con menos restricciones a través de un Programa de Verificación Cibernética ampliado.
Por qué importa
Para ingenieros de software y líderes técnicos, este cambio significa que Sonnet 5.5 no puede tratarse como un reemplazo directo de Sonnet 5 en todos los escenarios. La introducción de recursos alternativos visibles introduce variabilidad en el comportamiento y el rendimiento del modelo. Los desarrolladores ahora deben tener en cuenta la postura de seguridad tanto de Sonnet 5.5 como de Sonnet 5, ya que el modelo anterior podría manejar solicitudes sensibles una vez activado. Este entorno de doble modelo requiere pruebas cuidadosas para asegurar que los recursos alternativos no introduzcan vulnerabilidades inesperadas ni rompan la continuidad del flujo de trabajo.
Además, el alcance de lo que activa una salvaguarda va más allá de los prompts del usuario. Dado que las comprobaciones revisan todo lo que el modelo lee, incluido el contenido de repositorios, avisos de seguridad o páginas web, los agentes que extraen datos externos pueden activar inadvertidamente un recurso alternativo. Esto crea un posible punto débil para ataques de inyección de prompts. Las pruebas revelaron que instrucciones inyectadas para borrar discos o eliminar archivos a menudo activaban el bloqueo cibernético, llevando a un reenvío donde el 12,01% de esas solicitudes fueron comprometidas. Los equipos que usan recursos alternativos deben, por lo tanto, endurecer sus sistemas contra inyecciones indirectas de prompts que podrían explotar el modelo de recurso alternativo menos seguro.
Qué puedes hacer
- Revisa tu configuración de API para decidir si activar el recurso automático para solicitudes de alto riesgo.
- Actualiza la lógica de tu aplicación para manejar los recursos alternativos visibles e identificar el modelo generado en la respuesta.
- Asegúrate de probar tus flujos de trabajo considerando el comportamiento dual de Sonnet 5.5 y Sonnet 5 bajo condiciones de seguridad.
- Implementa medidas adicionales contra inyecciones de prompts indirectas, especialmente si utilizas agentes que procesan datos externos.
- Monitorea las tasas de bloqueo y reenvío para ajustar tus expectativas de rendimiento y seguridad.


