Anthropic lanza Claude Haiku 5.5 con nueva estructura de precios y cambios en la tokenización
Anthropic ha lanzado Claude Haiku 5.5, igualando los precios de GPT-6 Luna de OpenAI para contextos cortos, pero introduciendo un tokenizador menos eficiente y mayores costes para entradas largas.
Traducido automáticamente del original en inglés.
Anthropic ha lanzado Claude Haiku 5.5, un modelo de lenguaje rápido y de bajo coste diseñado para competir directamente con las ofertas recientes de OpenAI. Esta actualización llega acompañada de cambios significativos en las estructuras de precios, la eficiencia de la tokenización y las ventajas de suscripción para usuarios de API. Este lanzamiento marca un cambio estratégico en cómo Anthropic posiciona su modelo de gama de entrada frente a competidores como GPT-6 Luna.
Qué ha ocurrido
La iteración anterior, Haiku 4.5, se había vuelto relativamente cara en comparación con las alternativas del mercado. Su precio era de 1 dólar por millón de tokens de entrada y 5 dólares por millón de tokens de salida. Esta tarifa era diez veces superior a la de GPT-6 Luna de OpenAI, que se lanzó el mes pasado. Haiku 5.5 cierra esta brecha igualando exactamente el precio base de Luna: 0,10 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida. Sin embargo, esta tarifa competitiva solo se aplica a contextos de hasta 100.000 tokens.
Más allá del umbral de 100.000 tokens, el precio de Haiku 5.5 aumenta cinco veces, pasando a 0,50 dólares para la entrada y 2,50 dólares para la salida. En contraste, GPT-6 Luna mantiene tarifas más bajas para contextos más largos, aumentando solo a 0,20/0,75 dólares después de 272.000 tokens. Esta estructura sugiere que, aunque Haiku 5.5 es competitivo en costes para tareas estándar, se vuelve significativamente más caro para el procesamiento de datos a gran escala o aplicaciones de contexto largo en comparación con su principal rival.
Otro cambio crítico involucra al tokenizador subyacente. Haiku 5.5 utiliza un nuevo tokenizador menos generoso que su predecesor. Las pruebas indican que el mismo prompt largo consume aproximadamente 1,25 veces más tokens en Haiku 5.5 que en Haiku 4.5. Esta ineficiencia actúa como un aumento de precio oculto, lo que significa que los usuarios pueden pagar más por el mismo contenido incluso dentro del nivel más barato. Para cargas de trabajo que permanecen por debajo de 100.000 tokens, Haiku reporta puntuaciones de referencia (benchmarks) más altas que Luna, pero para entradas más grandes, Luna parece ser la opción más económica.
Cómo funciona
Haiku 5.5 introduce capacidades de razonamiento que no se pueden desactivar, estableciéndose por defecto en un nivel de esfuerzo medio. Los usuarios pueden ajustar el esfuerzo de pensamiento entre bajo, medio, alto, xhigh y max. Los ajustes de esfuerzo inferior producen resultados más rápidos con un coste mínimo, mientras que los ajustes superiores activan trazas de razonamiento más profundas. Por ejemplo, generar una imagen SVG de un pelícano en bicicleta tardó siete segundos y costó aproximadamente 0,09 centavos con esfuerzo bajo. La misma tarea con esfuerzo máximo tardó más de cinco minutos, pero aún así costó solo unos 3,38 centavos, demostrando el equilibrio entre latencia y profundidad computacional.
El modelo también se integra con herramientas de desarrollo actualizadas. El plugin llm-anthropic ahora admite actualizaciones dinámicas de modelos, eliminando la necesidad de nuevas versiones de software para cada lanzamiento de modelo. Esto permite a los desarrolladores probar nuevas capacidades inmediatamente utilizando interfaces de línea de comandos. La función de traza de razonamiento ofrece visibilidad sobre el proceso de toma de decisiones del modelo, lo cual puede ser útil para depurar salidas complejas o entender el rendimiento en benchmarks.
Detalles clave
- Haiku 5.5 iguala los precios de GPT-6 Luna en 0,10/0,50 dólares por millón de tokens para entradas de hasta 100.000 tokens.
- Los precios aumentan cinco veces a 0,50/2,50 dólares por millón de tokens para contextos que superan los 100.000 tokens.
- El nuevo tokenizador es menos eficiente, utilizando 1,25x más tokens que Haiku 4.5 para el mismo texto.
- El razonamiento no se puede desactivar; se establece por defecto en esfuerzo medio y admite niveles hasta max.
- Anthropic está reduciendo a la mitad el precio de las lecturas de caché para Sonnet 5.5.
- Los suscriptores Max y Team ahora reciben créditos mensuales de API equivalentes al costo de su suscripción.
Por qué importa
Para los ingenieros de software que construyen funciones impulsadas por IA, el cambio de nivel de precios en los 100.000 tokens es una restricción arquitectónica crítica. Las aplicaciones que procesan frecuentemente documentos largos o mantienen extensos historiales de conversación enfrentarán penalizaciones de costos elevadas con Haiku 5.5 en comparación con GPT-6 Luna. Los desarrolladores deben monitorear cuidadosamente el uso de la ventana de contexto para evitar picos inesperados en la facturación. El costo oculto del nuevo tokenizador complica aún más la previsión presupuestaria, requiriendo que los equipos reevalúen las métricas de consumo de tokens de modelos anteriores.
La introducción de un razonamiento no desactivable cambia el perfil de rendimiento del modelo. Si bien esto puede mejorar la precisión para tareas de lógica compleja, introduce una latencia variable que puede impactar la experiencia de usuario en aplicaciones en tiempo real. Los equipos que dependen de tiempos de respuesta predecibles necesitarán probar diferentes niveles de esfuerzo para encontrar el equilibrio adecuado entre velocidad y calidad. La incapacidad de apagar el razonamiento significa que incluso las consultas simples pueden incurren en una sobrecarga computacional ligeramente mayor que en versiones anteriores.
Qué puedes hacer
- Audita tu uso actual de tokens para determinar si la mayoría de las solicitudes caen por debajo del umbral de 100.000 tokens.
- Realiza pruebas comparativas (benchmarking) de Haiku 5.5 contra GPT-6 Luna para tus flujos de trabajo específicos de contexto largo para comparar los costos totales.
- Prueba diferentes niveles de esfuerzo de razonamiento para identificar la configuración óptima para los requisitos de latencia de tu aplicación.
- Actualiza tu plugin llm-anthropic a la última versión para admitir el cambio dinámico de modelos sin volver a desplegar.
- Revisa tu nivel de suscripción de Anthropic para reclamar los nuevos créditos mensuales de API a través de la configuración de Facturación.
- Configura la desactivación de la recarga automática si planeas agotar tus créditos mensuales de API para evitar cargos por excedentes.



