Actualités IA

Google Gemini 4 Argon domine le travail de connaissance mais limite l'accès au codage

Google a lancé Gemini 4 Argon, un nouveau modèle phare qui surpasse ses rivaux dans les tâches de connaissance et le raisonnement en contexte long, bien que les résultats en codage soient variables et la disponibilité reste restreinte.

Traduit automatiquement depuis l'original anglais.

Google a officiellement dévoilé Gemini 4 Argon, son dernier modèle d'intelligence artificielle phare, se positionnant comme une alternative supérieure aux offres actuelles d'OpenAI et d'Anthropic. Annoncé le 30 septembre 2026, le modèle démontre des avantages significatifs dans le travail de connaissance et le traitement de contextes longs, bien que ses performances dans les benchmarks de codage soient incohérentes. L'accès au système est actuellement limité à un groupe restreint de testeurs et de partenaires gouvernementaux alors que Google navigue dans une stratégie de déploiement par étapes.

Ce qui s'est passé

Cette sortie marque un tournant dans le calendrier récent de l'IA chez Google, remplaçant effectivement le plan Gemini 3.5 Pro précédemment annoncé par cette itération plus avancée. Alors que l'entreprise prévoyait initialement de lancer un nouveau modèle Pro en juin 2026, elle a plutôt déployé une série de modèles Flash avant d'arriver à Argon. Cette annonce fait suite à une réunion entre le PDG de Google, Sundar Pichai, et le président Donald Trump, où Pichai a rejoint les dirigeants d'Anthropic, Meta, Nvidia, OpenAI et SpaceX pour signer un engagement volontaire à auto-réguler le développement de l'IA. Cet accord manque de mécanismes formels d'application, mais signale une coordination accrue de l'industrie sur les normes de sécurité.

Gemini 4 Argon obtient des scores supérieurs ou égaux dans 13 des 18 benchmarks comparés à GPT-6 Astra d'OpenAI ainsi qu'à Claude Opus 5.5 et Fable 5.1 d'Anthropic. Le modèle montre une force particulière dans les tâches impliquant la synthèse complexe d'informations et l'automatisation. Par exemple, il obtient 51,3 % sur AutomationBench de Zapier, soit près de neuf points de plus que Claude Opus 5.5. Dans les contextes juridiques, Argon atteint 19,6 % sur le Legal Agent Benchmark de Harvey, ce qui est presque trois fois le score de Claude Fable 5.1, bien que cela indique encore qu'il ne complète entièrement qu'environ une tâche sur cinq.

Malgré ces victoires, le modèle est en retard par rapport aux concurrents dans des domaines techniques spécifiques. Sur le benchmark de codage FrontierSWE v2, Argon obtient 55,0 %, accusant un retard de 10,5 points derrière GPT-6 Astra et de neuf points derrière Claude Opus 5.5. Il se classe également dernier sur Terminal-Bench 4.0 parmi les modèles comparés. Ces résultats mitigés suggèrent que, bien qu'Argon soit optimisé pour la connaissance générale et les flux de travail agentiques, il pourrait ne pas encore être le choix définitif pour toutes les tâches d'ingénierie logicielle. Google prévoit de recueillir les retours des premiers testeurs dans son programme Fairwind avant d'étendre l'accès aux clients API payants et aux abonnés AI Ultra.

Comment cela fonctionne

Une caractéristique distinctive de Gemini 4 Argon est sa capacité de sortie étendue. Alors que un million de jetons d'entrée est devenu la norme pour les modèles de pointe, Argon peut générer jusqu'à un million de jetons de sortie dans une seule réponse. Les modèles Gemini précédents étaient limités à 64 000 jetons de sortie. Cette augmentation permet au modèle de s'engager dans des processus de raisonnement plus profonds, générant des centaines de milliers de jetons pour résoudre des problèmes complexes en une seule trajectoire sans les diviser en étapes plus petites.

Le modèle intègre également un entraînement spécialisé pour les applications de cybersécurité. Google a entraîné Argon pour identifier, valider et corriger autonomement les vulnérabilités logicielles. Pour les participants au programme Fairwind et les équipes internes, le modèle est publié sans certaines protections cyber afin de faciliter ce travail. Wiz, une entreprise de sécurité acquise par Google pour 32 milliards de dollars en mars 2026, utilise déjà Argon dans son initiative Scan for Good. À ce titre, le modèle aurait découvert une vulnérabilité critique dans un logiciel de santé utilisé mondialement, que les modèles de pointe précédents n'avaient pas détectée.

Détails clés

  • Gemini 4 Argon obtient 68,9 % sur l'Index Vals pour le travail de connaissance, surpassant GPT-6 Astra (63,1 %) et Claude Opus 5.5 (67,0 %).
  • Le modèle prend en charge jusqu'à un million de jetons de sortie, une augmentation significative par rapport à la limite de 64 000 jetons des versions précédentes.
  • Le prix d'introduction est fixé à 2 $ par million de jetons d'entrée et 10 $ par million de jetons de sortie, augmentant respectivement à 4 $ et 20 $ ultérieurement.
  • Argon atteint 84,2 % sur le benchmark GraphWalks pour les entrées comprises entre 256K et 1M de jetons, devançant GPT-6 Astra de plus de 12 points.
  • Dans les tests de cybersécurité, Argon obtient 85,8 % sur le benchmark interne de découverte de vulnérabilités de Google et 70,9 % sur le benchmark de tests d'intrusion de Wiz.
  • L'accès est actuellement restreint au programme Fairwind et aux partenaires du gouvernement américain, avec une disponibilité plus large prévue à des dates ultérieures.

Pourquoi c'est important

Pour les développeurs et les fondateurs techniques, la performance mitigée de Gemini 4 Argon en codage suggère que la sélection du modèle doit rester spécifique à la tâche. Bien que le score élevé sur DeepSWE v1.1 (77,9 %) indique de fortes capacités dans certains flux de travail d'ingénierie logicielle, les scores inférieurs sur FrontierSWE v2 et Terminal-Bench 4.0 impliquent qu'il pourrait ne pas remplacer les modèles de codage spécialisés pour tous les cas d'utilisation. Les équipes construisant des flux de travail agentiques pour le travail de connaissance, l'analyse juridique ou l'automatisation trouveront probablement une valeur immédiate, mais celles concentrées uniquement sur la génération de code devraient continuer à évaluer des alternatives comme GPT-6 Astra ou Claude Opus 5.5.

L'expansion des jetons de sortie à un million change la façon dont les ingénieurs peuvent concevoir les prompts et les boucles d'agents. Au lieu d'enchaîner plusieurs appels API pour maintenir le contexte ou décomposer de grandes tâches, les développeurs peuvent potentiellement compter sur une seule passe de génération longue. Cela pourrait simplifier l'architecture pour les tâches de raisonnement complexes, mais pourrait augmenter la latence et le coût par requête. La structure tarifaire d'introduction offre un avantage temporaire en termes de coûts, mais l'augmentation de prix prévue à 20 $ par million de jetons de sortie l'aligne avec les concurrents premium, nécessitant une modélisation soignée des coûts pour les applications de production.

Ce que vous pouvez faire

  • Évaluez vos flux de travail actuels pour identifier les tâches qui bénéficient du raisonnement en contexte long plutôt que de la génération rapide de code.
  • Postulez pour accéder au programme Fairwind si votre organisation est éligible aux opportunités de test anticipé.
  • Comparez vos agents existants aux scores rapportés sur AutomationBench et l'Index Vals pour estimer les gains de performance potentiels.
  • Revoyez vos schémas d'utilisation de jetons pour vous préparer au passage vers des limites de sortie plus élevées et les coûts associés.
  • Suivez le calendrier de déploiement pour les clients API payants et les abonnés AI Ultra afin de planifier les délais d'intégration.
  • Considérez les implications sécuritaires de l'utilisation de modèles sans protections cyber si vous participez à des programmes de recherche de vulnérabilités.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles