Développer avec l’IA

Anthropic lance Claude Haiku 5.5 avec une nouvelle tarification et des modifications de tokenisation

Anthropic a lancé Claude Haiku 5.5, alignant ses prix sur ceux du GPT-6 Luna d'OpenAI pour les contextes courts, mais introduisant un tokenizer moins efficace et des coûts plus élevés pour les entrées longues.

A glass cube with glowing circuits next to priced paper notes
Illustration générée pour cet article

Traduit automatiquement depuis l'original anglais.

Anthropic a publié Claude Haiku 5.5, un modèle de langage rapide et économique conçu pour concurrencer directement les offres récentes d'OpenAI. Cette mise à jour s'accompagne de changements importants dans les structures tarifaires, l'efficacité de la tokenisation et les avantages d'abonnement pour les utilisateurs de l'API. Ce lancement marque un tournant stratégique dans la manière dont Anthropic positionne son modèle d'entrée de gamme face aux concurrents comme le GPT-6 Luna.

Ce qui s'est passé

L'itération précédente, Haiku 4.5, était devenue relativement chère par rapport aux alternatives du marché. Elle était facturée 1 $ par million de tokens d'entrée et 5 $ par million de tokens de sortie. Ce tarif était dix fois supérieur à celui du GPT-6 Luna d'OpenAI, lancé seulement le mois dernier. Haiku 5.5 comble cet écart en s'alignant exactement sur le prix de base de Luna : 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie. Cependant, ce tarif compétitif ne s'applique qu'aux contextes allant jusqu'à 100 000 tokens.

Au-delà du seuil de 100 000 tokens, le prix de Haiku 5.5 est multiplié par cinq, passant à 0,50 $ pour l'entrée et 2,50 $ pour la sortie. En revanche, le GPT-6 Luna maintient des tarifs inférieurs pour les contextes plus longs, n'augmentant qu'à 0,20 $/0,75 $ après 272 000 tokens. Cette structure suggère que si Haiku 5.5 est compétitif en termes de coûts pour les tâches standard, il devient nettement plus cher pour le traitement de données à grande échelle ou les applications à long contexte par rapport à son principal rival.

Un autre changement critique concerne le tokenizer sous-jacent. Haiku 5.5 utilise un nouveau tokenizer moins généreux que son prédécesseur. Les tests indiquent que la même longue invite consomme environ 1,25 fois plus de tokens dans Haiku 5.5 que dans Haiku 4.5. Cette inefficacité agit comme une augmentation de prix cachée, signifiant que les utilisateurs pourraient payer plus cher pour le même contenu, même dans la tranche tarifaire moins coûteuse. Pour les charges de travail restant sous les 100 000 tokens, Haiku affiche des scores de référence supérieurs à ceux de Luna, mais pour les entrées plus volumineuses, Luna semble être le choix plus économique.

Comment cela fonctionne

Haiku 5.5 introduit des capacités de raisonnement qui ne peuvent pas être désactivées, avec un niveau d'effort moyen par défaut. Les utilisateurs peuvent ajuster l'effort de réflexion entre faible, moyen, élevé, très élevé (xhigh) et maximal. Des paramètres d'effort inférieurs produisent des résultats plus rapides avec un coût minimal, tandis que des paramètres plus élevés engagent des traces de raisonnement plus profondes. Par exemple, la génération d'une image SVG d'un pélican sur un vélo a pris sept secondes et a coûté environ 0,09 centime avec un effort faible. La même tâche avec un effort maximal a pris plus de cinq minutes mais n'a coûté que 3,38 centimes, illustrant le compromis entre latence et profondeur de calcul.

Le modèle s'intègre également à des outils de développement mis à jour. Le plugin llm-anthropic prend désormais en charge les actualisations dynamiques de modèles, éliminant le besoin de nouvelles versions logicielles pour chaque sortie de modèle. Cela permet aux développeurs de tester immédiatement les nouvelles capacités via des interfaces en ligne de commande. La fonctionnalité de trace de raisonnement offre une visibilité sur le processus de prise de décision du modèle, utile pour déboguer des sorties complexes ou comprendre les performances de référence.

Détails clés

  • Haiku 5.5 s'aligne sur la tarification du GPT-6 Luna à 0,10 $/0,50 $ par million de tokens pour les entrées allant jusqu'à 100 000 tokens.
  • Les prix sont multipliés par cinq, atteignant 0,50 $/2,50 $ par million de tokens pour les contextes dépassant 100 000 tokens.
  • Le nouveau tokenizer est moins efficace, utilisant 1,25 fois plus de tokens que Haiku 4.5 pour le même texte.
  • Le raisonnement ne peut pas être désactivé ; il est réglé par défaut sur un effort moyen et prend en charge des niveaux jusqu'à max.
  • Anthropic réduit de moitié le prix des lectures de cache pour Sonnet 5.5.
  • Les abonnés Max et Team reçoivent désormais des crédits API mensuels équivalents au coût de leur abonnement.

Pourquoi c'est important

Pour les ingénieurs logiciels développant des fonctionnalités basées sur l'IA, la rupture de palier tarifaire à 100 000 tokens constitue une contrainte architecturale critique. Les applications traitant fréquemment des documents longs ou maintenant des historiques de conversation étendus feront face à des pénalités de coûts sévères avec Haiku 5.5 comparées au GPT-6 Luna. Les développeurs doivent surveiller attentivement l'utilisation de la fenêtre de contexte pour éviter des pics de facturation inattendus. Le coût caché du nouveau tokenizer complique davantage la prévision budgétaire, obligeant les équipes à réévaluer les métriques de consommation de tokens issues des modèles précédents.

L'introduction d'un raisonnement non désactivable modifie le profil de performance du modèle. Bien que cela puisse améliorer la précision pour les tâches de logique complexe, cela introduit une latence variable pouvant affecter l'expérience utilisateur dans les applications temps réel. Les équipes dépendant de temps de réponse prévisibles devront tester différents niveaux d'effort pour trouver le juste équilibre entre vitesse et qualité. L'impossibilité de désactiver le raisonnement signifie que même les requêtes simples peuvent entraîner une surcharge computationnelle légèrement supérieure à celle des versions précédentes.

Ce que vous pouvez faire

  • Auditez votre utilisation actuelle de tokens pour déterminer si la plupart des requêtes restent sous le seuil de 100 000 tokens.
  • Comparez Haiku 5.5 au GPT-6 Luna via des benchmarks pour vos workflows spécifiques à long contexte afin d'évaluer les coûts totaux.
  • Testez différents niveaux d'effort de raisonnement pour identifier le réglage optimal pour votre application.
  • Mettez à jour votre plugin llm-anthropic pour bénéficier des actualisations dynamiques de modèles.
  • Vérifiez vos abonnements Max et Team pour activer les nouveaux crédits API mensuels.
  • Désactivez le rechargement automatique si nécessaire pour contrôler les mises à jour de modèles.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles