Dust: Eine vorgelagerte Transformator-Trainingsmethode ohne Rückwärtspropagation, die mit Backprop mithalten kann
Forscher stellen Dust vor, einen Optimierungsalgorithmus nullter Ordnung, der statt Gewichten die Aktivierungen stört, um Transformatoren ohne Rückwärtspropagation zu trainieren. Die Methode zeigt konkurrenzfähige Leistungsfähigkeit im großen Maßstab.
Automatisch aus dem englischen Original übersetzt.
Ein neues Forschungspapier stellt Dust vor, eine Optimierungsmethode nullter Ordnung, die Sprachmodelle auf Transformer-Basis ohne Rückwärtspropagation vortrainieren kann. Die Arbeit, veröffentlicht Anfang Oktober 2026, stellt die lang gehegte Annahme infrage, dass differenzierbare, gradientenbasierte Methoden für das Training großer neuronaler Netze zwingend erforderlich sind. Die Autoren zeigen, dass Dust durch die Störung von Aktivierungen anstelle von Gewichten in rechenintensiven Umgebungen die Leistung der herkömmlichen Rückwärtspropagation erreichen und sogar übertreffen kann.
Was ist passiert?
Deep Learning war historisch stark von der Rückwärtspropagation abhängig, einer Technik, bei der Gradienten berechnet werden, indem man sich rückwärts durch die Schichten eines Netzwerks bewegt. Diese Anforderung der Differenzierbarkeit hat nahezu jeden Aspekt der modernen KI-Infrastruktur geprägt, vom Hardware-Design bis zur Auswahl der Optimierer. Die Forscher hinter Dust argumentieren jedoch, dass Brute-Force-Suchmethoden mit dem Wachstum der globalen Rechenkapazität irgendwann analytische Gradientenmethoden übertreffen könnten. Sie verweisen auf die „bittere Lektion“ der KI-Geschichte, wonach allgemeine Methoden, die mit dem Rechenaufwand skalieren, tendenziell gegenüber solchen gewinnen, die auf spezifischen, menschengemachten induktiven Verzerrungen basieren.
Das Team präsentiert Dust als die erste Methode nullter Ordnung, die beim Vortrainieren von Transformatoren tatsächlich mit der Rückwärtspropagation konkurrieren kann. Methoden nullter Ordnung schätzen Gradienten typischerweise durch Abtasten der Verlustlandschaft, waren aber traditionell für große Modelle zu ineffizient. Dust überwindet dieses Hindernis durch das Konzept einer „virtuellen Population“. Anstatt mehrere Kopien des Modells mit leicht unterschiedlichen Gewichten zu erstellen, werden die Aktivierungen bei jedem Token unabhängig voneinander während eines einzigen Vorwärtsschritts gestört. Dies ermöglicht es jedem Token, als separates Mitglied der Population zu fungieren und viele Variationen parallel auszuwerten.
Die Ergebnisse zeigen, dass Dust die Rückwärtspropagation eng approximiert, wenn die Populationsgröße groß ist. In mehreren Testumgebungen übertraf sie sogar die Rückwärtspropagation, was darauf hindeutet, dass suchbasierte Algorithmen in Bereichen mit reichlich Rechenleistung überlegen sein könnten. Die Methode wurde bis zu 1 Milliarde Tokens getestet und behielt während des gesamten Skalierungsprozesses eine starke Übereinstimmung mit den Gradientenschätzungen der Rückwärtspropagation bei. Diese Konsistenz legt nahe, dass der Ansatz nicht nur eine kleine Kuriosität ist, sondern ein gangbarer Weg für größere Systeme.
Wie es funktioniert
Dust arbeitet, indem es Aktivierungen im Knotenraum statt im Gewichtsraum stört. Traditionelle Evolutionsstrategien (ES) wie EGGROLL modifizieren die Gewichte des Netzwerks, was erfordert, jede gestörte Version separat zu materialisieren und auszuwerten. Dieser Prozess ist rechenintensiv, da die Populationsgröße die Kosten direkt multipliziert. Dust umgeht diesen Engpass, indem es jedes Token in der Eingabesequenz als unabhängigen Datenpunkt für die Störung behandelt. Durch das Anwenden von Rauschen auf die Aktivierungen bei jedem Token evaluiert das System eine riesige virtuelle Population in einem einzigen Vorwärtsschritt.
Der Algorithmus weist Credits basierend darauf zu, wie stark jede Störung den Verlust reduziert. Er verwendet eine generische Credit-Zuweisungsregel, die Token-Level-Belohnungen auf verschiedene Schichttypen innerhalb des Transformer-Blocks verteilt. Dieser Ansatz nutzt jüngste Erkenntnisse aus der mechanistischen Interpretierbarkeit, die darauf hindeuten, dass Reasoning-Prozesse eher in den Aktivierungen als nur in den Gewichten residieren. Durch die Suche über Aktivierungen führt Dust effektiv eine Suche über latente Reasoning-Pfade durch. Die Methode enthält auch Implementierungsdetails, um Interferenzen zwischen gestörten Modulen zu verhindern und sicherzustellen, dass das Signal klar bleibt, wenn die Populationsgröße zunimmt.
Wichtige Details
- Dust ist eine Optimierungsmethode nullter Ordnung, die Aktivierungen statt Gewichte stört, um Gradienten zu schätzen.
- Die Methode nutzt eine „virtuelle Population“, in der jedes Token als unabhängiges Populationsmitglied fungiert und parallel während eines Vorwärtsschritts ausgewertet wird.
- Ab 1 Million Tokens wird Dust auf $10^3$ bis $10^4$ Mal effizienter als EGGROLL geschätzt, eine state-of-the-art Evolutionsstrategie im Gewichtsraum.
- Entgegen früheren Annahmen sind größere Modelle populations-effizienter; ein Modell mit 243 Millionen Parametern übertraf ein 120-mal kleineres Modell bei den meisten Populationsgrößen.
- Die Gradientenschätzungen von Dust stimmen gut mit der Rückwärtspropagation überein, wenn die Population wächst, und diese Übereinstimmung bleibt bis zu 1 Milliarde Tokens erhalten.
- Der Ansatz deutet darauf hin, dass suchbasierte Algorithmen in rechenreichen Umgebungen gradientenbasierte Methoden übertreffen könnten, indem sie die Verlustlandschaft breiter erkunden.
Warum es wichtig ist
Für Software-Ingenieure und ML-Praktiker eröffnet diese Forschung einen potenziellen Weg weg von den starren Einschränkungen der Differenzierbarkeit. Aktuelle Deep-Learning-Stacks sind stark auf die Rückwärtspropagation optimiert, was die Arten von Architekturen einschränkt, die effizient trainiert werden können. Wenn Methoden nullter Ordnung wie Dust skalieren können, könnten Entwickler die Freiheit gewinnen, nicht-differenzierbare Komponenten oder neuartige Architekturen zu verwenden, die zuvor unpraktikabel waren. Dies könnte zu Modellen mit besseren Generalisierungsfähigkeiten führen, da suchbasierte Methoden einige der schlechten lokalen Minima vermeiden können, auf die der Gradientenabstieg oft trifft.
Die Effizienzgewinne gegenüber traditionellen Evolutionsstrategien sind ebenfalls signifikant. Evolutionsstrategien im Gewichtsraum galten als zu langsam für große Sprachmodelle, aber Dasts aktivierungsbasierter Ansatz reduziert den Rechenoverhead um Größenordnungen. Dies macht es machbar, evolutionäre Ansätze für Vortrainingsaufgaben in Betracht zu ziehen, die zuvor ausschließlich der Domäne der Rückwärtspropagation vorbehalten waren. Da die Rechenressourcen weiter wachsen, könnte sich der Trade-off zwischen analytischer Präzision und Brute-Force-Suche zugunsten letzterer verschieben und damit die Art und Weise verändern, wie Basismodelle gebaut werden.
Was Sie tun können
- Lesen Sie das vollständige Paper, um die mathematische Formulierung des Mechanismus der virtuellen Population zu verstehen.
- Experimentieren Sie mit kleinen Transformer-Implementierungen unter Verwendung von Aktivierungsstörungen, um die Gradientenübereinstimmung aus erster Hand zu beobachten.
- Vergleichen Sie die Trainingsstabilität von Dust mit dem Standard-Stochastic-Gradient-Descent.
- Untersuchen Sie, ob dieser Ansatz in Ihrer Infrastruktur anwendbar ist, insbesondere dort, wo Nicht-Differenzierbarkeit ein Problem darstellt.
- Verfolgen Sie weitere Entwicklungen in der Community, da solche Methoden schnell iterieren.
- Bewerten Sie die potenziellen Auswirkungen auf Ihre bestehenden Modellarchitekturen und Trainingspipelines.



