Claude Sonnet 5.5 échange l'efficacité en tokens contre la performance agentique
Le nouveau modèle d'Anthropic atteint la deuxième place de l'Intelligence Index en utilisant considérablement plus de tokens de sortie, égalant les meilleurs agents sur les tâches de terminal tout en restant à la traîne en matière de connaissances factuelles.
Traduit automatiquement depuis l'original anglais.
Anthropic a publié Claude Sonnet 5.5, un modèle de milieu de gamme qui se classe désormais deuxième dans l'Artificial Analysis Intelligence Index. Publiée le 28 septembre 2026, cette mise à jour montre que le modèle réduit l'écart avec les concurrents phares dans les flux de travail agentiques, bien qu'il obtienne ces gains grâce à une consommation de tokens inhabituellement élevée plutôt qu'à une efficacité architecturale brute.
Ce qui s'est passé
Claude Sonnet 5.5 passe à la deuxième place de l'Intelligence Index, derrière Opus 5.5 en effort maximal. Le modèle gagne 18 points par rapport à son prédécesseur, Sonnet 5, principalement grâce à des améliorations massives dans l'utilisation du terminal et le travail de connaissance complexe. Dans Terminal-Bench 4.0, qui évalue la capacité des modèles à gérer les interactions en ligne de commande, Sonnet 5.5 obtient un score de 64 %. Cela le place légèrement devant Opus 5.5 et GPT-6 Astra, qui obtiennent chacun 60 %.
Malgré ces sauts de performance, le modèle ne domine pas toutes les catégories. Il reste derrière Opus 5.5 en connaissances factuelles et en raisonnement scientifique. Sur le benchmark AA-Omniscience pour l'exactitude factuelle, Sonnet 5.5 obtient un score de 54 % contre 66 % pour Opus 5.5. Cependant, il présente un taux d'hallucination inférieur de 47 % contre 59 % pour le modèle plus grand. Les évaluations ont été réalisées sur une version préliminaire contenant un bug affectant les sorties structurées, qu'Anthropic indique corrigé pour la version publique.
Comment cela fonctionne
Le mécanisme central derrière le classement amélioré de Sonnet 5.5 est son paramètre « max effort » (effort maximal), qui déclenche une augmentation extrême de l'utilisation des tokens de sortie. Pour accomplir les tâches de l'Intelligence Index, le modèle génère environ 193 000 tokens de sortie par tâche. C'est la plus grande utilisation de tokens enregistrée par Artificial Analysis, dépassant Opus 5.5 et Sonnet 5 d'environ 60 % et surpassant GPT-6 Astra d'environ sept fois. Le modèle force essentiellement la résolution de problèmes complexes en générant de longues chaînes de réflexion et des étapes de vérification.
Anthropic propose cinq paramètres d'effort : low (faible), medium (moyen), high (élevé), xhigh (très élevé) et max (maximal). Les évaluations de l'Intelligence Index ont été effectuées sur les cinq niveaux avec les replis par défaut activés. Le modèle n'a basculé vers la version précédente Sonnet 5 que dans 0,1 % des tâches, principalement dans Terminal-Bench 4.0. Bien que le paramètre d'effort maximal conduise à une position élevée au classement, les paramètres d'effort inférieurs sont moins compétitifs. Aux efforts low, medium et high, les configurations GPT-6 Sol offrent des performances équivalentes ou meilleures avec moins de tokens de sortie.
Détails clés
- Classement : Deuxième dans l'Artificial Analysis Intelligence Index, derrière Opus 5.5 (max).
- Utilisation de tokens : Utilise ~193k tokens de sortie par tâche à l'effort maximal, la plus élevée mesurée à ce jour.
- Tarification : Identique à Sonnet 5 à $0.2/$2/$10 par 1M cache input/input/output tokens.
- Coût par tâche : Environ $7.60 par tâche, soit 50 % plus cher que Sonnet 5.
- Performance Terminal : Score de 64% sur Terminal-Bench 4.0, surpassant Opus 5.5 et GPT-6 Astra.
- Fenêtre de contexte : Reste inchangée à 1 million de tokens pour l'entrée texte et image.
Pourquoi c'est important
Pour les équipes d'ingénierie construisant des systèmes agentiques, Sonnet 5.5 présente un compromis entre capacité et efficacité coût. Le modèle égale ou dépasse les principaux concurrents dans l'utilisation pratique du terminal et les benchmarks d'automatisation comme AA-Briefcase et AutomationBench-AA. Cela en fait un candidat solide pour les flux de travail nécessitant une interaction profonde avec les environnements de développement ou des pipelines de traitement de données complexes. Cependant, cette performance s'accompagne d'un prix significatif. Le coût par tâche est d'environ $7.60, ce qui rend son exécution nettement plus chère que celle de son prédécesseur pour le même volume de travail.
Le positionnement de Sonnet 5.5 met également en évidence un changement dans la manière dont les modèles de milieu de gamme concurrencent. Plutôt que d'essayer de battre les modèles phares sur la densité de raisonnement pure, Anthropic a optimisé Sonnet 5.5 pour dépenser plus de calcul et de tokens afin d'atteindre des résultats similaires. Pour les développeurs, cela signifie que le choix entre Sonnet 5.5 et des modèles comme GPT-6 Sol dépend fortement de la tâche spécifique. Si le budget de tokens est serré, GPT-6 Sol peut offrir une meilleure valeur aux niveaux d'effort inférieurs. Si la tâche nécessite une persistance agentique maximale dans un environnement terminal, Sonnet 5.5 à l'effort maximal devient une alternative viable, quoique coûteuse, à Opus 5.5.
Ce que vous pouvez faire
- Benchmark vos flux de travail agentiques actuels contre Sonnet 5.5 à l'effort maximal pour voir si le score de 64% sur Terminal-Bench se traduit par une fiabilité réelle.
- Comparez le coût par tâche de $7.60 avec votre budget existant pour Sonnet 5 ou GPT-6 Sol afin de déterminer la viabilité financière.
- Testez les cinq paramètres d'effort individuellement pour trouver l'équilibre optimal entre l'utilisation de tokens et la précision pour votre cas d'utilisation spécifique.
- Surveillez les taux d'hallucination si l'exactitude factuelle est critique, notant que Sonnet 5.5 a un taux inférieur à celui d'Opus 5.5 mais aussi des scores factuels globaux plus faibles.
- Vérifiez la gestion des sorties structurées dans vos applications, en vous assurant que vous exécutez la version publique où le bug préliminaire a été corrigé.
- Évaluez si la fenêtre de contexte de 1 million de tokens répond à vos besoins, car cette spécification n'a pas changé par rapport à la version précédente.
