Olmo-core 3 escala el entrenamiento de mixture-of-experts a billones de parámetros
Hugging Face lanza Olmo-core 3, una infraestructura abierta que aumenta el rendimiento del entrenamiento MoE y admite modelos con más de un billón de parámetros totales.
Traducido automáticamente del original en inglés.
Hugging Face ha lanzado Olmo-core 3, una actualización importante de su framework de código abierto para el entrenamiento de grandes modelos de lenguaje. Publicado el 1 de octubre de 2026, esta versión introduce un sistema rediseñado específicamente optimizado para arquitecturas mixture-of-experts (MoE), lo que permite escalar eficientemente hasta la gama de billones de parámetros.
Qué ocurrió
El lanzamiento aborda un cuello de botella crítico en el desarrollo moderno de IA: el alto costo y consumo energético del entrenamiento de modelos masivos. Aunque los modelos MoE ofrecen eficiencia teórica al activar solo un subconjunto de parámetros para cada entrada, la sobrecarga de coordinar estos expertos entre clústeres de GPU suele erosionar dichas ganancias. Olmo-core 3 busca cerrar esta brecha replanteando cómo se distribuyen los datos y los pesos del modelo durante el entrenamiento.
En pruebas internas, el nuevo framework demostró mejoras significativas de rendimiento. Al aumentar el conjunto de expertos de 8 a 128 manteniendo fijos en aproximadamente 3.200 millones los parámetros activos por token, la capacidad total de parámetros creció de 4.600 millones a 47.000 millones. A pesar de este enorme aumento en el tamaño del modelo, el rendimiento del entrenamiento cayó menos del 5 por ciento. La infraestructura también ha sido probada a escalas superiores a un billón de parámetros totales.
Esta evolución marca un cambio respecto a iteraciones anteriores. Mientras que Olmo 3 utilizaba una arquitectura densa donde casi todos los parámetros estaban activos para cada token, Olmo-core 3 está diseñado desde cero para diseños MoE dispersos. Reemplaza el enfoque anterior de paralelismo de datos totalmente fragmentado (fully sharded data parallelism) con un sistema basado en paralelismo de datos distribuido, manteniendo los expertos residentes en las GPUs para evitar la recolección repetida de pesos.
Cómo funciona
Olmo-core 3 distribuye el modelo y su estado de entrenamiento entre el hardware utilizando tres técnicas principales. El paralelismo de expertos reparte los componentes especializados entre diferentes GPUs, de modo que cada dispositivo almacena solo una fracción del conjunto total de expertos. El paralelismo de pipeline divide las capas del modelo entre grupos de GPUs, reduciendo los requisitos de memoria por dispositivo. Un optimizador distribuido ahorra aún más memoria al repartir el estado del optimizador entre el clúster en lugar de replicarlo en cada GPU.
Para minimizar la sobrecarga de comunicación, el framework emplea varias optimizaciones. El paralelismo de expertos por filas coloca los datos enrutados directamente en los buffers de entrada de los expertos, reduciendo los costos de reorganización de datos. El enrutamiento residente en GPU mantiene los metadatos en los procesadores gráficos, permitiendo que la CPU encolare trabajo sin esperar transferencias de datos. Además, las operaciones GEMM agrupadas combinan muchas computaciones pequeñas en lotes más grandes, mejorando la eficiencia de ejecución de la GPU.
El sistema también admite MXFP8, un formato numérico de menor precisión que reduce los costos de movimiento de datos y cómputo. En pruebas con GPUs NVIDIA B300, habilitar MXFP8 aumentó el rendimiento del entrenamiento en aproximadamente un 21 por ciento en comparación con la línea base BF16, mientras reducía el uso máximo de memoria activa. Estas características trabajan juntas para equilibrar las compensaciones entre velocidad de cómputo y latencia de transferencia de datos.
Detalles clave
- Olmo-core 3 logró un rendimiento 2,7 veces superior al de su predecesor en pruebas preliminares con ocho GPUs NVIDIA B300.
- El framework admite modelos con más de un billón de parámetros totales, demostrado en una prueba con 58.360 millones de parámetros activos por token.
- El uso de la precisión MXFP8 mejoró el rendimiento en un 21 por ciento y redujo la memoria máxima de 103 GiB a 95 GiB en pruebas controladas.
- El sistema identifica un fenómeno llamado "gerrymandering de tokens", donde las puntuaciones de enrutamiento mejoran incluso cuando el equilibrio de carga empeora.
- Superponer comunicación y cómputo en streams separados de GPU no siempre aumentó la velocidad y a veces ralentizó la ejecución.
- Reducir las tasas de aprendizaje para los expertos no mejoró los resultados en las familias de modelos probadas, contrariamente a algunas suposiciones comunes.
Por qué importa
Para equipos de ingeniería que construyen sistemas de IA a gran escala, Olmo-core 3 ofrece una alternativa transparente a stacks de entrenamiento propietarios como Megatron-Core de NVIDIA. Al abrir el código de la infraestructura detrás de sus modelos de próxima generación, Hugging Face permite a investigadores y laboratorios más pequeños experimentar con arquitecturas MoE sin quedar atrapados en ecosistemas específicos de proveedores. Esta transparencia es crucial para comprender las características reales de rendimiento de los modelos dispersos.
Los hallazgos técnicos incluidos en el lanzamiento destacan trampas importantes para los desarrolladores. Por ejemplo, el descubrimiento de que superponer comunicación y cómputo puede degradar el rendimiento desafía las heurísticas estándar de optimización. De manera similar, la observación de que los valores de entrada afectan el tiempo de cómputo incluso cuando las dimensiones de la matriz permanecen constantes sugiere que las pruebas de referencia deben realizarse con cuidado. Estos conocimientos ayudan a los ingenieros a evitar configuraciones erróneas costosas al escalar sus propios modelos.
Qué puedes hacer
- Revisa el informe técnico de Olmo-core 3 para entender las ablativas específicas y las decisiones de diseño tomadas durante el desarrollo.
- Experimenta con el código de fuente abierta en GitHub para probar configuraciones de entrenamiento MoE en tu propio hardware.
- Utiliza la guía interactiva proporcionada por Hugging Face.


