Actualités IA

Le modèle Gemini 4 Argon de Google égale les meilleurs modèles d'IA à moitié prix

Google DeepMind lance Gemini 4 Argon, qui égale GPT-6 Astra sur les benchmarks d'intelligence tout en offrant des avantages significatifs en termes de coûts grâce à des remises initiales et une mise en cache améliorée.

Traduit automatiquement depuis l'original anglais.

Google DeepMind revient au premier plan du développement de l'intelligence artificielle avec la sortie de Gemini 4 Argon, un nouveau modèle propriétaire qui égale les performances des principaux concurrents. Lancé fin septembre 2026, ce modèle atteint la parité avec le GPT-6 Astra d'OpenAI sur les métriques clés d'intelligence, tout en fonctionnant actuellement à un coût nettement inférieur par tâche grâce à une tarification promotionnelle.

Ce qui s'est passé

Gemini 4 Argon représente le premier modèle propriétaire de Google supérieur à sa classe Flash depuis plus de sept mois. Sur l'Artificial Analysis Intelligence Index, le modèle obtient un score de 53, identique au score maximal atteint par GPT-6 Astra et supérieur d'un point à celui de GPT-6.1 Sol. Cela marque une amélioration substantielle pour Google, le plaçant fermement parmi les trois premiers laboratoires d'IA en matière de capacité brute d'intelligence. Le précédent modèle non-Flash de Google, Gemini 3.1 Pro Preview, n'avait obtenu que 30 points sur le même index, indiquant un bond majeur dans les performances.

L'aspect économique de cette sortie est tout aussi notable. Actuellement, Google offre une remise de 50 % sur ses tarifs, ce qui ramène le coût par tâche de l'Intelligence Index à 1,99 $. Cela représente environ 60 % du coût nécessaire pour exécuter une tâche comparable sur GPT-6 Astra, dont le tarif est de 3,26 $ par tâche. Cependant, cette efficacité est due à des prix inférieurs par token plutôt qu'à une réduction de l'utilisation de tokens. En effet, Gemini 4 Argon génère en moyenne 62 000 tokens de sortie par tâche, soit plus du double des 27 000 tokens utilisés par GPT-6 Astra. Une fois la remise promotionnelle terminée, le coût par tâche passera à 3,98 $, le rendant légèrement plus cher que GPT-6 Astra mais restant compétitif face aux autres modèles haut de gamme.

Comment cela fonctionne

L'architecture technique de Gemini 4 Argon prend en charge une fenêtre de contexte d'un million de tokens et accepte des entrées multimodales incluant texte, image, vidéo et audio, bien qu'il ne produise que du texte en sortie. Une innovation clé dans son déploiement est l'introduction de la Long Decode Continuation. Cette fonctionnalité API permet de mettre en pause et de reprendre les réponses longues via des appels ultérieurs, permettant aux processus de raisonnement de s'étendre jusqu'à un million de tokens de sortie sans déclencher de délais d'expiration des requêtes. Ceci est particulièrement utile pour les flux de travail agentiques complexes nécessitant une logique étape par étape approfondie.

Les améliorations de performance sont également évidentes dans les capacités agentiques et la fiabilité du modèle. Historiquement, les modèles Gemini ont pris du retard sur les tâches d'agents autonomes, mais Argon se classe premier sur AutomationBench-AA avec un score de 78 %, surpassant Claude Sonnet 5.5. Il montre également une amélioration spectaculaire sur Terminal Bench 4, gagnant 53 points par rapport à son prédécesseur. De plus, le modèle présente le taux d'hallucination le plus bas parmi les modèles leaders obtenant plus de 45 points sur l'index d'intelligence. Avec un taux d'hallucination de 15 %, il est beaucoup plus susceptible d'admettre son ignorance que de deviner incorrectement, bien que son score brut de précision de 50 % soit inférieur à celui de GPT-6 Astra.

Détails clés

  • Score d'intelligence : Obtient 53 sur l'Artificial Analysis Intelligence Index, égalant GPT-6 Astra (max) et dépassant GPT-6.1 Sol (max).
  • Tarification : Actuellement réduit de 50 % à 2 $/10 $ par million de tokens d'entrée/sortie, résultant en un coût de 1,99 $ par tâche ; le tarif standard sera de 4 $/20 $.
  • Mise en cache : Les tokens d'entrée mis en cache bénéficient d'une remise de 95 %, coûtant 0,10 $ par million de tokens, une augmentation par rapport à la remise de 90 % des versions précédentes.
  • Performance agentique : Se classe #1 sur AutomationBench-AA à 78 % et atteint un score de 57 % sur Terminal Bench 4.
  • Fiabilité : Présente un taux d'hallucination de 15 %, le plus bas parmi les modèles haut de gamme, bien que la précision globale soit de 50 %.
  • Disponibilité : Déploiement actuel auprès d'utilisateurs sélectionnés et pas encore disponible publiquement ; la date de fin de la remise de 50 % n'est pas confirmée.

Pourquoi c'est important

Pour les ingénieurs logiciels et les fondateurs techniques, le retour de Google comme concurrent de premier plan introduit une pression saine sur les normes de prix et de performance. La capacité d'égaler les scores d'intelligence les plus élevés tout en offrant un coût d'entrée inférieur pendant la période promotionnelle permet aux équipes d'expérimenter avec des modèles à fort raisonnement sans contrainte budgétaire immédiate. L'amélioration significative des capacités agentiques suggère que Gemini 4 Argon pourrait être un solide candidat pour construire des agents autonomes nécessitant une utilisation robuste des outils et une planification multi-étapes, domaines où les itérations précédentes de Gemini avaient peiné.

Cependant, les développeurs doivent évaluer attentivement le compromis entre le coût et l'efficacité des tokens. Bien que le coût par tâche soit inférieur pendant la promotion, la forte utilisation de tokens signifie que les applications sensibles à la latence ou ayant des budgets stricts en tokens pourraient nécessiter une optimisation. Le faible taux d'hallucination est un avantage critique pour les applications exigeant une grande fiabilité, telles que les assistants juridiques ou médicaux, où admettre l'incertitude est préférable à fournir des informations incorrectes. À mesure que le modèle se dirige vers une disponibilité générale, la compréhension de ces caractéristiques opérationnelles sera essentielle pour une intégration efficace.

Ce que vous pouvez faire

  • Postulez pour un accès anticipé si vous êtes un utilisateur sélectionné afin de tester les flux de travail agentiques utilisant la nouvelle fonctionnalité Long Decode Continuation.
  • Évaluez soigneusement le compromis entre le coût et l'efficacité des tokens avant de migrer vos charges de travail.
  • Exploitez la mise en cache pour réduire davantage les coûts sur les entrées répétitives.
  • Testez les capacités agentiques sur des workflows complexes pour vérifier la fiabilité dans votre contexte spécifique.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles