IA ouverte et locale

Olmo-core 3 étend l'entraînement mixture-of-experts aux paramètres à l'échelle du billion

Hugging Face publie Olmo-core 3, une infrastructure ouverte qui améliore le débit d'entraînement MoE et prend en charge des modèles comptant plus de mille milliards de paramètres au total.

Traduit automatiquement depuis l'original anglais.

Hugging Face a publié Olmo-core 3, une mise à jour majeure de son framework open source dédié à l'entraînement de grands modèles de langage. Publiée le 1er octobre 2026, cette version introduit un système repensé, spécifiquement optimisé pour les architectures mixture-of-experts (MoE), permettant une montée en échelle efficace vers la gamme des mille milliards de paramètres.

Ce qui s'est passé

Cette publication répond à un goulot d'étranglement critique dans le développement moderne de l'IA : le coût élevé et la consommation énergétique liés à l'entraînement de modèles massifs. Bien que les modèles MoE offrent une efficacité théorique en n'activant qu'un sous-ensemble de paramètres pour chaque entrée, la surcharge liée à la coordination de ces experts à travers les clusters GPU érode souvent ces gains. Olmo-core 3 vise à combler ce fossé en repensant la distribution des données et des poids du modèle pendant l'entraînement.

Lors de tests internes, le nouveau framework a démontré des améliorations significatives des performances. En augmentant le pool d'experts de 8 à 128 tout en maintenant les paramètres actifs par token fixes à environ 3,2 milliards, la capacité totale en paramètres est passée de 4,6 milliards à 47 milliards. Malgré cette augmentation massive de la taille du modèle, le débit d'entraînement a chuté de moins de 5 %. L'infrastructure a également été testée à des échelles dépassant mille milliards de paramètres au total.

Cette évolution marque une rupture avec les itérations précédentes. Alors qu'Olmo 3 utilisait une architecture dense où presque tous les paramètres étaient actifs pour chaque token, Olmo-core 3 est conçu dès le départ pour des designs MoE épars. Il remplace l'approche antérieure de parallélisme de données entièrement sharded par un système basé sur le parallélisme de données distribué, gardant les experts résidents sur les GPU afin d'éviter la collecte répétée des poids.

Comment cela fonctionne

Olmo-core 3 distribue le modèle et son état d'entraînement sur le matériel en utilisant trois techniques principales. Le parallélisme d'experts répartit les composants spécialisés sur différents GPU, de sorte que chaque appareil ne stocke qu'une fraction du pool total d'experts. Le parallélisme de pipeline divise les couches du modèle entre les groupes de GPU, réduisant les exigences mémoire par appareil. Un optimiseur distribué économise davantage de mémoire en répartissant l'état de l'optimiseur sur le cluster plutôt qu'en le répliquant sur chaque GPU.

Pour minimiser la surcharge de communication, le framework emploie plusieurs optimisations. Le parallélisme d'experts par ligne place directement les données routées dans les tampons d'entrée des experts, réduisant les coûts de réarrangement des données. Le routage résident sur GPU conserve les métadonnées sur les processeurs graphiques, permettant au CPU de mettre en file d'attente les tâches sans attendre les transferts de données. De plus, les opérations GEMM groupées combinent de nombreux petits calculs en lots plus importants, améliorant l'efficacité d'exécution du GPU.

Le système prend également en charge MXFP8, un format de nombre à précision inférieure qui réduit les coûts de mouvement et de calcul des données. Lors de benchmarks sur des GPU NVIDIA B300, l'activation de MXFP8 a augmenté le débit d'entraînement d'environ 21 % par rapport à la base BF16, tout en réduisant l'utilisation maximale de la mémoire active. Ces fonctionnalités travaillent ensemble pour équilibrer les compromis entre vitesse de calcul et latence de transfert de données.

Détails clés

  • Olmo-core 3 a atteint un débit 2,7 fois supérieur à celui de son prédécesseur lors de tests préliminaires sur huit GPU NVIDIA B300.
  • Le framework prend en charge des modèles comptant plus de mille milliards de paramètres au total, comme démontré lors d'un test avec 58,36 milliards de paramètres actifs par token.
  • L'utilisation de la précision MXFP8 a amélioré le débit de 21 % et réduit la mémoire maximale de 103 GiB à 95 GiB lors de benchmarks contrôlés.
  • Le système identifie un phénomène appelé « gerrymandering des tokens », où les scores de routage s'améliorent même si l'équilibre de la charge se dégrade.
  • Le chevauchement des communications et des calculs sur des flux GPU distincts n'a pas toujours augmenté la vitesse et a parfois ralenti l'exécution.
  • La réduction des taux d'apprentissage pour les experts n'a pas amélioré les résultats dans les familles de modèles testées, contrairement à certaines hypothèses courantes.

Pourquoi c'est important

Pour les équipes d'ingénierie construisant des systèmes d'IA à grande échelle, Olmo-core 3 offre une alternative transparente aux stacks d'entraînement propriétaires comme Megatron-Core de NVIDIA. En ouvrant le code source de l'infrastructure derrière ses modèles de nouvelle génération, Hugging Face permet aux chercheurs et aux petits laboratoires d'expérimenter avec des architectures MoE sans être enfermés dans des écosystèmes de fournisseurs spécifiques. Cette transparence est cruciale pour comprendre les caractéristiques de performance réelles des modèles épars.

Les découvertes techniques incluses dans la publication mettent en lumière des pièges importants pour les développeurs. Par exemple, la découverte que le chevauchement des communications et des calculs peut parfois dégrader les performances remet en question les heuristiques d'optimisation standard. De même, l'observation que les valeurs d'entrée affectent le temps de calcul même lorsque les dimensions de la matrice restent constantes suggère que les benchmarks doivent être réalisés avec soin. Ces informations aident les ingénieurs à éviter des configurations erronées coûteuses lors de la montée en échelle de leurs propres modèles.

Ce que vous pouvez faire

  • Consultez le rapport technique d'Olmo-core 3 pour comprendre les ablations spécifiques et les choix de conception effectués lors du développement.
  • Expérimentez avec le code open source sur GitHub pour tester des configurations d'entraînement MoE sur votre propre matériel.
  • Utilisez le guide interactif fourni par Hugging Face.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles