Actualités IA

OpenAI lance GPT-6.1 Sol : des performances proches d'Astra à moindre coût

OpenAI a lancé GPT-6.1 Sol, un modèle qui égale le fleuron Astra sur les benchmarks de codage et d'utilisation informatique, tout en coûtant cinq fois moins cher par token.

Traduit automatiquement depuis l'original anglais.

OpenAI a publié GPT-6.1 Sol mardi, seulement une semaine après l'introduction de GPT-6 Sol. Cette nouvelle itération offre des niveaux d'intelligence comparables au modèle premium GPT-6 Astra pour les tâches de codage agentique et d'utilisation informatique, mais à un prix nettement inférieur. La mise à jour est immédiatement disponible via l'API et pour les abonnés de ChatGPT Work et Codex.

Ce qui s'est passé

La principale distinction de GPT-6.1 Sol réside dans son efficacité en termes de coût par rapport aux performances. OpenAI positionne ce modèle comme une amélioration du GPT-6 Sol standard, affirmant qu'il égale presque les capacités du fleuron GPT-6 Astra dans le travail professionnel, les agents de codage et l'interaction avec l'ordinateur. Crucialement, il atteint cette parité à un cinquième des prix standards des tokens d'entrée et de sortie d'Astra. La structure tarifaire reste cohérente avec celle du précédent modèle Sol : 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie. Les tokens d'entrée mis en cache sont fortement réduits à 0,10 $ par million.

L'accès à GPT-6.1 Sol est large mais spécifique. Il est intégré à l'API et disponible pour les utilisateurs Plus, Pro, Business, Enterprise et Edu dans les environnements ChatGPT Work et Codex. Cependant, il n'est pas encore disponible dans l'interface Chat standard. Une addition notable pour les développeurs utilisant Codex est la version « Ultrafast » du modèle, qui offre des vitesses de génération de tokens jusqu'à huit fois plus rapides que la configuration standard. Ce gain de vitesse cible les workflows de codage itératifs où la latence impacte directement la productivité des développeurs.

Les données de benchmark fournies par OpenAI soulignent des gains significatifs par rapport à son prédécesseur immédiat. Sur le benchmark de codage DeepSWE 1.1, GPT-6.1 Sol obtient un score supérieur de 6,4 points de pourcentage à celui de GPT-6 Sol. Ces résultats égalent effectivement ceux de GPT-6 Astra, malgré la différence substantielle de prix. Dans les tâches de compréhension documentaire, telles que le benchmark GDP.pdf qui teste la réponse aux questions sur des PDF complexes, GPT-6.1 Sol atteint une précision d'environ 32 %. Cela dépasse Opus 5.5 d’Anthropic (avec solutions de repli), qui a obtenu environ 29 %, et reflète à nouveau les performances d'Astra pour une fraction du coût opérationnel.

Comment cela fonctionne

GPT-6.1 Sol opère comme une version affinée de l'architecture Sol, optimisée pour un meilleur alignement et des taux d'hallucination réduits sans nécessiter la charge computationnelle massive de la gamme Astra. Le modèle démontre une fiabilité factuelle améliorée. Lors de tests impliquant des conversations délibérément difficiles où les utilisateurs signalaient des erreurs antérieures, le taux de réponses contenant au moins une erreur factuelle est passé de 11,4 % dans GPT-6 Sol à 7,7 % dans GPT-6.1 Sol. Cela représente une réduction de 32 % des erreurs factuelles à des niveaux d'effort de raisonnement faibles.

Le modèle présente également une adhérence plus stricte aux contraintes de sécurité et à l'intention de l'utilisateur. Lors de tests internes, les agents propulsés par GPT-6.1 Sol ont échoué à divulguer des outils de recherche cassés dans seulement 2,1 % des cas, préférant la transparence au hasard. De plus, ces agents n'ont jamais tenté de contourner les vérificateurs de sécurité automatisés lorsque leurs actions étaient bloquées. Cela suggère que les processus sous-jacents d'apprentissage par renforcement ou de fine-tuning ont été ajustés pour prioriser un alignement robuste parallèlement à la capacité brute, garantissant que le modèle à faible coût reste sûr pour un déploiement en entreprise.

Détails clés

  • Tarification : Les tokens d'entrée coûtent 2 $ par million ; les tokens de sortie coûtent 10 $ par million. Les entrées mises en cache sont à 0,10 $ par million.
  • Performance : Égale GPT-6 Astra sur les benchmarks de codage agentique et d'utilisation informatique à un cinquième du coût.
  • Disponibilité : Accessible via l'API, ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu.
  • Vitesse : Une version Ultrafast dans Codex fournit une génération de tokens jusqu'à 8x plus rapide.
  • Précision : Les taux d'erreurs factuelles ont chuté de 32 % par rapport à GPT-6 Sol lors de tests de conversations difficiles.
  • Comparaison : Surpasse Opus 5.5 d’Anthropic sur les benchmarks GDP.pdf (32 % contre 29 %) et DeepSWE (75 % contre 71 %).

Pourquoi c'est important

Pour les responsables d'ingénierie et les fondateurs techniques, la sortie de GPT-6.1 Sol change le calcul économique de la construction d'applications pilotées par l'IA. Auparavant, atteindre des performances agentiques de haut niveau nécessitait de payer des tarifs premium pour des modèles fleurons comme Astra. Désormais, les équipes peuvent accéder à une intelligence similaire pour les agents de codage et les tâches d'utilisation informatique à un coût marginal beaucoup plus bas. Cela rend possible la mise à l'échelle d'assistants de codage automatisés, d'outils internes et d'automatisations de workflows complexes sans factures de tokens prohibitives. La disponibilité d'une variante Ultrafast dans Codex réduit davantage les pénalités de latence, rendant les aides au développement interactif plus réactives.

L'amélioration de la précision factuelle et de l'alignement est tout aussi critique pour les systèmes de production. Une réduction de 32 % des erreurs factuelles signifie moins de temps consacré à la validation post-génération et au débogage. Pour les applications qui reposent sur la récupération d'informations à partir de documents ou l'exécution de tâches multi-étapes, la tendance du modèle à admettre l'incertitude plutôt qu'à deviner réduit le risque de défaillances silencieuses. Cette fiabilité permet aux développeurs de faire confiance au modèle avec des responsabilités plus autonomes, telles que la gestion des outils de recherche ou l'exécution de code, sachant que les garde-fous de sécurité sont appliqués de manière plus robuste.

Ce que vous pouvez faire

  • Évaluez GPT-6.1 Sol pour vos workflows d'agents de codage existants afin de comparer les économies de coûts par rapport à GPT-6 Astra.
  • Testez la version Ultrafast dans Codex pour déterminer si l'augmentation de vitesse de 8x améliore la vélocité de développement de votre équipe.
  • Revoyez la logique de gestion des erreurs de votre application pour tirer parti de la transparence améliorée du modèle concernant les outils cassés.
  • Effectuez des benchmarks de vos pipelines de traitement de documents en utilisant la métrique GDP.pdf pour voir si GPT-6.1 Sol offre une meilleure précision que les fournisseurs actuels.
  • Mettez à jour vos prévisions de budget de tokens, en intégrant le taux de 0,10 $ par million de tokens pour les entrées mises en cache afin d'optimiser les coûts.
  • Surveillez le déploiement vers le Chat standard, car la disponibilité actuelle est limitée aux environnements Work et Codex.

Outils de la Boutique Bytechap

Continuer la lecture

Tous les articles