Noticias de IA

Dust: Un método de preentrenamiento de transformers de orden cero que rivaliza con la retropropagación

Investigadores presentan Dust, un algoritmo de optimización de orden cero que perturba las activaciones en lugar de los pesos para entrenar transformers sin retropropagación, mostrando un rendimiento competitivo a gran escala.

A glass cube with glowing neural layers and floating dust particles representing activation perturbations.
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Un nuevo artículo de investigación introduce Dust, un método de optimización de orden cero capaz de preentrenar modelos de lenguaje transformer sin depender de la retropropagación. Publicado a principios de octubre de 2026, este trabajo desafía la suposición largamente sostenida de que los métodos basados en gradientes diferenciables son estrictamente necesarios para entrenar redes neuronales a gran escala. Los autores demuestran que, al perturbar las activaciones en lugar de los pesos, Dust puede igualar e incluso superar el rendimiento de la retropropagación tradicional en entornos con abundantes recursos computacionales.

Qué ocurrió

El aprendizaje profundo ha dependido históricamente de la retropropagación, una técnica que calcula los gradientes moviéndose hacia atrás a través de las capas de una red. Este requisito de diferenciabilidad ha moldeado casi todos los aspectos de la infraestructura moderna de IA, desde el diseño del hardware hasta la selección del optimizador. Sin embargo, los investigadores detrás de Dust argumentan que, a medida que crece la capacidad global de cómputo, los métodos de búsqueda por fuerza bruta podrían terminar superando a los métodos analíticos basados en gradientes. Citan la "lección amarga" de la historia de la IA, donde los métodos generales que escalan con el cómputo tienden a ganar sobre aquellos que dependen de sesgos inductivos diseñados específicamente por humanos.

El equipo presenta Dust como el primer método de orden cero verdaderamente competitivo con la retropropagación para el preentrenamiento de transformers. Los métodos de orden cero suelen estimar los gradientes muestreando el paisaje de pérdida, pero tradicionalmente han sido demasiado ineficientes para modelos grandes. Dust supera esto introduciendo el concepto de una "población virtual". En lugar de crear múltiples copias del modelo con pesos ligeramente diferentes, perturba las activaciones en cada token de forma independiente durante una sola pasada hacia adelante (forward pass). Esto permite que cada token actúe como un miembro separado de la población, evaluando muchas variaciones en paralelo.

Los resultados indican que Dust aproxima la retropropagación estrechamente cuando el tamaño de la población es grande. En varias configuraciones de prueba, incluso superó a la retropropagación, sugiriendo que en regímenes donde el cómputo es abundante, los algoritmos basados en búsqueda podrían volverse superiores. El método fue probado hasta 1 mil millones de tokens, manteniendo una fuerte alineación con las estimaciones de gradiente de la retropropagación a lo largo del proceso de escalado. Esta consistencia sugiere que el enfoque no es solo una curiosidad a pequeña escala, sino una vía viable para sistemas más grandes.

Cómo funciona

Dust opera perturbando las activaciones en el espacio de nodos en lugar del espacio de pesos. Las estrategias evolutivas tradicionales (ES) como EGGROLL modifican los pesos de la red, lo que requiere materializar y evaluar cada versión perturbada por separado. Este proceso es computacionalmente costoso porque el tamaño de la población multiplica directamente el costo. Dust evita este cuello de botella tratando cada token en la secuencia de entrada como un punto de datos independiente para la perturbación. Al aplicar ruido a las activaciones en cada token, el sistema evalúa una vasta población virtual en una sola pasada hacia adelante.

El algoritmo asigna crédito basado en cuánto reduce cada perturbación la pérdida. Utiliza una regla genérica de asignación de crédito que distribuye recompensas a nivel de token entre diferentes tipos de capas dentro del bloque transformer. Este enfoque aprovecha hallazgos recientes en interpretabilidad mecanicista, que sugieren que los procesos de razonamiento residen en las activaciones y no solo en los pesos. Al buscar sobre las activaciones, Dust efectivamente realiza una búsqueda sobre rutas de razonamiento latentes. El método también incluye detalles de implementación para prevenir interferencias entre módulos perturbados, asegurando que la señal permanezca clara a medida que aumenta el tamaño de la población.

Detalles clave

  • Dust es un método de optimización de orden cero que perturba las activaciones en lugar de los pesos para estimar gradientes.
  • El método utiliza una "población virtual" donde cada token actúa como un miembro independiente de la población, evaluado en paralelo durante una sola pasada hacia adelante.
  • Desde 1 millón de tokens en adelante, se estima que Dust es $10^3$ a $10^4$ veces más eficiente que EGGROLL, una estrategia evolutiva de estado del arte en el espacio de pesos.
  • Contrario a creencias previas, los modelos más grandes son más eficientes en términos de población; un modelo de 243M de parámetros superó a un modelo 120 veces más pequeño en la mayoría de los tamaños de población.
  • Las estimaciones de gradiente de Dust se alinean bien con la retropropagación a medida que crece la población, manteniendo esta alineación hasta 1 mil millones de tokens.
  • El enfoque sugiere que en regímenes ricos en cómputo, los algoritmos basados en búsqueda pueden superar a los métodos basados en gradientes explorando el paisaje de pérdida de manera más amplia.

Por qué importa

Para ingenieros de software y profesionales de ML, esta investigación abre una posible vía lejos de las rígidas restricciones de la diferenciabilidad. Las pilas actuales de aprendizaje profundo están fuertemente optimizadas para la retropropagación, limitando los tipos de arquitecturas que pueden entrenarse eficientemente. Si métodos de orden cero como Dust pueden escalar, los desarrolladores podrían ganar la libertad de usar componentes no diferenciables o arquitecturas novedosas que previamente eran impracticables. Esto podría llevar a modelos con mejores capacidades de generalización, ya que los métodos basados en búsqueda pueden evitar algunos de los mínimos locales pobres que el descenso de gradiente suele encontrar.

Las ganancias de eficiencia sobre las estrategias evolutivas tradicionales también son significativas. La ES en el espacio de pesos ha sido considerada demasiado lenta para grandes modelos de lenguaje, pero el enfoque basado en activaciones de Dust reduce la sobrecarga computacional por órdenes de magnitud. Esto hace factible considerar enfoques evolutivos para tareas de preentrenamiento que previamente fueron dominio exclusivo de la retropropagación. A medida que los recursos de cómputo continúan expandiéndose, el equilibrio entre precisión analítica y búsqueda por fuerza bruta podría cambiar a favor de la última, remodelando cómo se construyen los modelos fundacionales.

Qué puedes hacer

  • Lee el artículo completo para entender la formulación matemática del mecanismo de población virtual.
  • Experimenta con implementaciones de transformers a pequeña escala utilizando perturbación de activaciones para observar la alineación de gradientes de primera mano.
  • Compara la estabilidad de entrenamiento de Dust contra el descenso de gradiente estocástico estándar en tareas simples de modelado de lenguaje.
  • Integra componentes no diferenciables en tus pipelines experimentales si tienes acceso a recursos de cómputo suficientes para probar métodos de orden cero.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo
$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos