AWS lance Strands Decider 2B pour la validation locale des agents
AWS a lancé Strands Decider 2B, un modèle de décision téléchargeable qui valide les actions des agents IA en local avec une latence inférieure à 100 ms.
Traduit automatiquement depuis l'original anglais.
Amazon Web Services a présenté Strands Decider 2B, un modèle de décision compact conçu pour s'exécuter en local et valider les actions des agents IA avant leur exécution. Sorti le 1er octobre 2026, cet outil offre aux développeurs un mécanisme rapide et fiable pour vérifier les sorties des agents sans dépendre d'API externes ni générer du texte invalide.
Ce qui s'est passé
Ce lancement place AWS directement face aux modèles de décision émergents comme Jev de TypeSafe, qui a récemment déclenché une vague d'outils similaires chez les principaux fournisseurs d'IA. Alors qu'OpenAI a récemment présenté en préversion son API Decisions hébergée utilisant le modèle Luna, AWS a adopté une approche différente en publiant un modèle entièrement téléchargeable. Ce package inclut non seulement les poids, mais aussi les données d'entraînement et les scripts, permettant aux ingénieurs d'inspecter et d'adapter la recette sous-jacente.
Strands Decider 2B fait partie de l'écosystème plus large Strands, incubé au sein de Strands Labs, le pôle expérimental d'AWS dédié à l'IA agentique. Il succède à la récente sortie de Strands Harness, qui fournit l'infrastructure nécessaire pour faire tourner des agents de plus longue durée. En offrant une alternative ouverte et locale aux services hébergés, AWS vise à donner aux développeurs davantage de contrôle sur les étapes critiques de validation dans leurs workflows d'agents.
Comment cela fonctionne
Les modèles de décision diffèrent des grands modèles de langage standard en restreignant leur espace de sortie. Au lieu de générer du texte libre, ils sélectionnent parmi des options fournies par le développeur ou renvoient des scores numériques. Strands Decider utilise Qwen3.5-2B comme base, désignée sous le nom de « torse ». L'équipe a supprimé la tête de modèle de langage standard responsable de la génération de texte et l'a remplacée par une tête de pointeur contenant un peu plus d'un million de paramètres. Cette tête évalue les options de réponse fournies.
Le réseau principal utilise un adaptateur d'adaptation à faible rang (LoRA) de rang 16. En limitant les sorties possibles uniquement à celles fournies par le développeur, le modèle ne peut pas inventer des options inexistantes. Cette architecture garantit que chaque sortie est valide dans le contexte défini, bien qu'elle ne garantisse pas la justesse dans tous les cas. Ce compromis permet des décisions plus rapides et des scores de confiance calibrés, que les applications peuvent utiliser pour déterminer les prochaines étapes.
En pratique, cela permet des vérifications avant exécution. Par exemple, si un agent propose d'appeler un outil météo sans ville spécifiée, le Decider évalue si les arguments sont fondés sur la conversation. Si des informations manquent, le système peut renvoyer l'agent vers l'utilisateur pour demander une clarification plutôt que d'exécuter un appel d'outil défaillant. Ce processus passe par le système d'intervention de Strands, permettant aux développeurs de définir des politiques pour procéder, refuser ou demander une confirmation humaine.
Détails clés
- Le modèle est construit sur Qwen3.5-2B avec une tête de pointeur personnalisée remplaçant la couche de génération de texte.
- Il atteint des temps de décision inférieurs à 100 millisecondes sur un GPU Nvidia RTX 3090.
- Sur un MacBook M3, les temps de réponse médians pour les petites tâches sont d'environ 150 millisecondes.
- Strands Decider 2B se classe deuxième parmi les modèles publics d'environ 2 milliards de paramètres sur JevBench.
- Il se classe premier parmi les modèles publics fournissant une recette d'entraînement complète et les données associées.
- La version publiée inclut toutes les itérations architecturales précédentes dans le dépôt pour plus de transparence.
Pourquoi c'est important
Pour les ingénieurs logiciels développant des agents autonomes, la fiabilité est souvent l'obstacle majeur. Les modèles génératifs peuvent halluciner des arguments d'outils ou manquer des contraintes critiques, entraînant des erreurs difficiles à déboguer. Strands Decider 2B répond à ce problème en insérant une vérification rapide et déterministe entre le raisonnement de l'agent et ses actions. Cette séparation des responsabilités permet aux modèles génératifs de gérer la conversation complexe et la créativité, tandis que le modèle de décision gère le routage et la validation.
La nature locale du modèle est significative pour les applications sensibles à la latence et la confidentialité des données. Exécuter la validation sur l'appareil élimine le temps d'aller-retour réseau associé aux API hébergées. De plus, l'inclusion des données d'entraînement et des scripts prend en charge l'affinage pour des domaines spécifiques. Les développeurs ne sont plus enfermés dans la logique propriétaire d'un fournisseur ; ils peuvent adapter le modèle à leurs contraintes opérationnelles uniques et vérifier son comportement grâce aux benchmarks fournis.
Ce que vous pouvez faire
- Téléchargez Strands Decider 2B depuis le dépôt officiel.
- Intégrez le modèle dans votre workflow d'agent pour effectuer des validations locales.
- Utilisez les scripts fournis pour affiner le modèle sur vos propres données.
- Configurez le système d'intervention de Strands pour définir vos politiques de validation.
- Comparez les performances avec d'autres solutions via les benchmarks disponibles.

