Claude Sonnet 5.5 intercambia eficiencia en tokens por rendimiento agéntico
El nuevo modelo de Anthropic alcanza el segundo puesto en el Índice de Inteligencia utilizando significativamente más tokens de salida, igualando a los agentes de primer nivel en tareas de terminal mientras se queda atrás en conocimiento factual.
Traducido automáticamente del original en inglés.
Anthropic ha lanzado Claude Sonnet 5.5, un modelo de gama media que ahora ocupa el segundo lugar en el Índice de Inteligencia de Artificial Analysis. Publicado el 28 de septiembre de 2026, esta actualización muestra cómo el modelo cierra la brecha con los competidores insignia en flujos de trabajo agénticos, aunque logra estas mejoras mediante un consumo inusualmente alto de tokens en lugar de una eficiencia arquitectónica pura.
Qué ocurrió
Claude Sonnet 5.5 asciende al segundo puesto en el Índice de Inteligencia, solo por detrás de Opus 5.5 en esfuerzo máximo. El modelo gana 18 puntos sobre su predecesor, Sonnet 5, impulsado principalmente por mejoras masivas en el uso de terminal y en el trabajo de conocimiento complejo. En Terminal-Bench 4.0, que evalúa qué tan bien manejan los modelos las interacciones con la línea de comandos, Sonnet 5.5 obtiene una puntuación del 64 por ciento. Esto lo coloca ligeramente por delante tanto de Opus 5.5 como de GPT-6 Astra, que puntúan cada uno un 60 por ciento.
A pesar de estos saltos de rendimiento, el modelo no lidera en todas las categorías. Sigue estando por detrás de Opus 5.5 en conocimiento factual y razonamiento científico. En el benchmark AA-Omniscience para precisión factual, Sonnet 5.5 obtiene un 54 por ciento frente al 66 por ciento de Opus 5.5. Sin embargo, exhibe una tasa de alucinaciones menor, del 47 por ciento frente al 59 por ciento del modelo más grande. Las evaluaciones se realizaron en una versión previa al lanzamiento que contenía un error que afectaba a las salidas estructuradas, el cual Anthropic afirma que está corregido en la versión pública.
Cómo funciona
El mecanismo central detrás de la mejora en la clasificación de Sonnet 5.5 es su configuración de "esfuerzo máximo", que provoca un aumento extremo en el uso de tokens de salida. Para completar las tareas del Índice de Inteligencia, el modelo genera aproximadamente 193.000 tokens de salida por tarea. Este es el mayor uso de tokens registrado por Artificial Analysis, superando a Opus 5.5 y Sonnet 5 en alrededor del 60 por ciento y sobrepasando a GPT-6 Astra por unas siete veces. El modelo esencialmente resuelve problemas complejos mediante fuerza bruta, generando extensas cadenas de pensamiento y pasos de verificación.
Anthropic ofrece cinco configuraciones de esfuerzo: bajo, medio, alto, xhigh (extra alto) y max (máximo). Las evaluaciones del Índice de Inteligencia se ejecutaron en los cinco niveles con las alternativas predeterminadas habilitadas. El modelo recurrió a la versión anterior, Sonnet 5, en solo el 0,1 por ciento de las tareas, principalmente dentro de Terminal-Bench 4.0. Si bien la configuración de esfuerzo máximo impulsa la alta posición en la tabla de clasificación, las configuraciones de esfuerzo inferior son menos competitivas. En esfuerzos bajo, medio y alto, las configuraciones de GPT-6 Sol ofrecen un rendimiento equivalente o mejor con menos tokens de salida.
Detalles clave
- Clasificación: Segundo en el Índice de Inteligencia de Artificial Analysis, detrás de Opus 5.5 (max).
- Uso de Tokens: Utiliza ~193k tokens de salida por tarea en esfuerzo máximo, el más alto medido hasta la fecha.
- Precios: Idéntico a Sonnet 5, a $0.2/$2/$10 por 1M de tokens de entrada/entrada caché/salida.
- Costo por Tarea: Aproximadamente $7.60 por tarea, lo que es un 50 por ciento más alto que Sonnet 5.
- Rendimiento en Terminal: Puntúa 64% en Terminal-Bench 4.0, superando a Opus 5.5 y GPT-6 Astra.
- Ventana de Contexto: Permanece sin cambios en 1 millón de tokens para entrada de texto e imagen.
Por qué importa
Para los equipos de ingeniería que construyen sistemas agénticos, Sonnet 5.5 presenta un equilibrio entre capacidad y eficiencia de costos. El modelo iguala o supera a los principales competidores en el uso práctico de terminal y en benchmarks de automatización como AA-Briefcase y AutomationBench-AA. Esto lo convierte en un candidato sólido para flujos de trabajo que requieren una interacción profunda con entornos de desarrollo o pipelines complejos de procesamiento de datos. Sin embargo, este rendimiento viene con un precio significativo. El costo por tarea es de aproximadamente $7.60, lo que hace sustancialmente más caro ejecutarlo que a su predecesor para el mismo volumen de trabajo.
La posicionamiento de Sonnet 5.5 también destaca un cambio en cómo compiten los modelos de gama media. En lugar de intentar vencer a los modelos insignia en densidad de razonamiento pura, Anthropic ha optimizado Sonnet 5.5 para gastar más cómputo y tokens para alcanzar resultados similares. Para los desarrolladores, esto significa que la elección entre Sonnet 5.5 y modelos como GPT-6 Sol depende en gran medida de la tarea específica. Si el presupuesto de tokens es ajustado, GPT-6 Sol puede ofrecer mejor valor en niveles de esfuerzo inferiores. Si la tarea requiere máxima persistencia agéntica en un entorno de terminal, Sonnet 5.5 en esfuerzo máximo se convierte en una alternativa viable, aunque costosa, a Opus 5.5.
Qué puedes hacer
- Realiza pruebas de referencia (benchmarking) de tus flujos de trabajo agénticos actuales contra Sonnet 5.5 en esfuerzo máximo para ver si la puntuación del 64% en Terminal-Bench se traduce en fiabilidad en el mundo real.
- Compara el costo por tarea de $7.60 con tu presupuesto existente para Sonnet 5 o GPT-6 Sol para determinar la viabilidad financiera.
- Prueba las cinco configuraciones de esfuerzo individualmente para encontrar el equilibrio óptimo entre uso de tokens y precisión para tu caso de uso específico.
- Monitorea el rendimiento para asegurarte de que las mejoras justifican el incremento en los costos operativos.
