Dust : une méthode de préentraînement des transformateurs d'ordre zéro qui rivalise avec la rétropropagation
Des chercheurs présentent Dust, un algorithme d'optimisation d'ordre zéro qui perturbe les activations plutôt que les poids pour entraîner des transformateurs sans rétropropagation, démontrant des performances compétitives à grande échelle.
Traduit automatiquement depuis l'original anglais.
Un nouvel article de recherche présente Dust, une méthode d'optimisation d'ordre zéro capable de préentraîner des modèles de langage basés sur des transformateurs sans recourir à la rétropropagation. Publié début octobre 2026, ce travail remet en question l'hypothèse longtemps admise selon laquelle les méthodes différentiables basées sur le gradient sont strictement nécessaires pour entraîner des réseaux de neurones à grande échelle. Les auteurs démontrent qu'en perturbant les activations plutôt que les poids, Dust peut égaler, voire parfois dépasser, les performances de la rétropropagation traditionnelle dans des environnements riches en ressources de calcul.
Ce qui s'est passé
L'apprentissage profond a historiquement reposé sur la rétropropagation, une technique qui calcule les gradients en remontant à travers les couches d'un réseau. Cette exigence de différentiabilité a façonné presque tous les aspects de l'infrastructure moderne de l'IA, depuis la conception du matériel jusqu'à la sélection des optimiseurs. Cependant, les chercheurs derrière Dust soutiennent que, à mesure que la capacité mondiale de calcul augmente, les méthodes de recherche par force brute pourraient finir par surpasser les méthodes analytiques basées sur le gradient. Ils citent la « leçon amère » de l'histoire de l'IA, selon laquelle les méthodes générales qui passent à l'échelle grâce au calcul finissent souvent par l'emporter sur celles reposant sur des biais inductifs spécifiques conçus par l'homme.
L'équipe présente Dust comme la première méthode d'ordre zéro véritablement compétitive face à la rétropropagation pour le préentraînement des transformateurs. Les méthodes d'ordre zéro estiment généralement les gradients en échantillonnant le paysage de la fonction de perte, mais elles ont traditionnellement été trop inefficaces pour les grands modèles. Dust surmonte cet obstacle en introduisant le concept de « population virtuelle ». Au lieu de créer plusieurs copies du modèle avec des poids légèrement différents, il perturbe les activations pour chaque jeton indépendamment lors d'une seule passe avant. Cela permet à chaque jeton d'agir comme un membre distinct de la population, évaluant de nombreuses variations en parallèle.
Les résultats indiquent que Dust approxime étroitement la rétropropagation lorsque la taille de la population est importante. Dans plusieurs configurations de test, il a même surpassé la rétropropagation, suggérant que dans les régimes où le calcul est abondant, les algorithmes basés sur la recherche pourraient devenir supérieurs. La méthode a été testée jusqu'à 1 milliard de jetons, maintenant un alignement fort avec les estimations de gradient de la rétropropagation tout au long du processus de mise à l'échelle. Cette cohérence suggère que l'approche n'est pas seulement une curiosité à petite échelle, mais une voie viable pour des systèmes plus vastes.
Comment cela fonctionne
Dust opère en perturbant les activations dans l'espace des nœuds plutôt que dans l'espace des poids. Les stratégies d'évolution traditionnelles (ES) comme EGGROLL modifient les poids du réseau, ce qui nécessite de matérialiser et d'évaluer chaque version perturbée séparément. Ce processus est coûteux en calcul car la taille de la population multiplie directement le coût. Dust contourne ce goulot d'étranglement en traitant chaque jeton de la séquence d'entrée comme un point de données indépendant pour la perturbation. En appliquant du bruit aux activations de chaque jeton, le système évalue une vaste population virtuelle en une seule passe avant.
L'algorithme attribue le crédit en fonction de la réduction de la perte apportée par chaque perturbation. Il utilise une règle générique d'attribution de crédit qui distribue les récompenses au niveau des jetons entre différents types de couches au sein du bloc de transformateur. Cette approche s'appuie sur des découvertes récentes en interprétabilité mécaniste, qui suggèrent que les processus de raisonnement résident dans les activations plutôt que uniquement dans les poids. En effectuant une recherche sur les activations, Dust réalise efficacement une exploration des chemins de raisonnement latents. La méthode inclut également des détails d'implémentation pour empêcher les interférences entre les modules perturbés, garantissant que le signal reste clair à mesure que la taille de la population augmente.
Détails clés
- Dust est une méthode d'optimisation d'ordre zéro qui perturbe les activations plutôt que les poids pour estimer les gradients.
- La méthode utilise une « population virtuelle » où chaque jeton agit comme un membre indépendant de la population, évalué en parallèle lors d'une seule passe avant.
- À partir de 1 million de jetons, Dust est estimé être $10^3$ à $10^4$ fois plus efficace qu'EGGROLL, une stratégie d'évolution dans l'espace des poids à la pointe de la technologie.
- Contrairement aux croyances précédentes, les modèles plus grands sont plus efficaces en termes de population ; un modèle de 243 millions de paramètres a surpassé un modèle 120 fois plus petit à la plupart des tailles de population.
- Les estimations de gradient de Dust s'alignent bien avec la rétropropagation à mesure que la population croît, maintenant cet alignement jusqu'à 1 milliard de jetons.
- L'approche suggère que dans les régimes riches en calcul, les algorithmes basés sur la recherche pourraient surpasser les méthodes basées sur le gradient en explorant le paysage de la perte plus largement.
Pourquoi c'est important
Pour les ingénieurs logiciels et les praticiens du ML, cette recherche ouvre une voie potentielle loin des contraintes rigides de la différentiabilité. Les piles actuelles d'apprentissage profond sont fortement optimisées pour la rétropropagation, limitant les types d'architectures pouvant être entraînés efficacement. Si les méthodes d'ordre zéro comme Dust peuvent passer à l'échelle, les développeurs pourraient gagner la liberté d'utiliser des composants non différentiables ou des architectures nouvelles qui étaient auparavant impraticables. Cela pourrait conduire à des modèles ayant de meilleures capacités de généralisation, car les méthodes basées sur la recherche pourraient éviter certains minima locaux médiocres que la descente de gradient rencontre souvent.
Les gains d'efficacité par rapport aux stratégies d'évolution traditionnelles sont également significatifs. L'ES dans l'espace des poids a été considérée comme trop lente pour les grands modèles de langage, mais l'approche basée sur les activations de Dust réduit la surcharge computationnelle par plusieurs ordres de grandeur. Cela rend envisageable d'utiliser des approches évolutionnistes pour des tâches de préentraînement qui étaient auparavant le domaine exclusif de la rétropropagation. À mesure que les ressources de calcul continuent de s'étendre, l'arbitrage entre précision analytique et recherche par force brute pourrait pencher en faveur de cette dernière, remodelant la façon dont les modèles fondamentaux sont construits.
Ce que vous pouvez faire
- Lire l'article complet pour comprendre la formulation mathématique du mécanisme de population virtuelle.
- Expérimenter avec des implémentations de transformateurs à petite échelle utilisant la perturbation des activations pour observer l'alignement des gradients de première main.
- Comparer la stabilité d'entraînement de Dust contre la descente de gradient stochastique standard sur des tâches simples de modélisation du langage.
- Prendre en compte ces insights pour anticiper les futures évolutions des infrastructures d'IA.



