Dust: Eine vorgelagerte Transformator-Trainingsmethode ohne Rückwärtspropagation, die mit Backprop mithalten kann
Forscher stellen Dust vor, einen Optimierungsalgorithmus nullter Ordnung, der statt Gewichten die Aktivierungen stört, um Transformatoren ohne Rückwärtspropagation zu trainieren. Die Methode zeigt konkurrenzfähige Leistungsfähigkeit im großen Maßstab.




