Offene & lokale KI

Olmo-core 3 skaliert Mixture-of-Experts-Training auf Billionen Parameter

Hugging Face veröffentlicht Olmo-core 3, eine offene Infrastruktur, die den Durchsatz beim MoE-Training steigert und Modelle mit über einer Billion Gesamtparametern unterstützt.

Automatisch aus dem englischen Original übersetzt.

Hugging Face hat Olmo-core 3 veröffentlicht, ein großes Update seines Open-Source-Frameworks für das Training großer Sprachmodelle. Die am 1. Oktober 2026 publizierte Version stellt ein neu gestaltetes System vor, das speziell für Mixture-of-Experts-Architekturen (MoE) optimiert ist und effizientes Skalieren in den Bereich von Billionen Parametern ermöglicht.

Was passiert ist

Das Release adressiert einen kritischen Engpass in der modernen KI-Entwicklung: die hohen Kosten und den Energieverbrauch beim Training massiver Modelle. Während MoE-Modelle theoretische Effizienz bieten, indem sie nur eine Teilmenge der Parameter für jede Eingabe aktivieren, wird dieser Vorteil oft durch den Overhead bei der Koordination dieser Experten über GPU-Cluster hinweg zunichte gemacht. Olmo-core 3 zielt darauf ab, diese Lücke zu schließen, indem es die Verteilung von Daten und Modellgewichten während des Trainings neu denkt.

In internen Benchmarks zeigte das neue Framework erhebliche Leistungsverbesserungen. Als der Expertenpool von 8 auf 128 erhöht wurde, während die aktiven Parameter pro Token bei etwa 3,2 Milliarden fixiert blieben, wuchs die gesamte Parameterkapazität von 4,6 Milliarden auf 47 Milliarden. Trotz dieses enormen Anstiegs der Modellgröße sank der Trainingsdurchsatz um weniger als 5 Prozent. Die Infrastruktur wurde auch bei Maßstäben getestet, die eine Billion Gesamtparameter überschreiten.

Diese Entwicklung markiert einen Wandel gegenüber früheren Iterationen. Während Olmo 3 eine dichte Architektur nutzte, bei der nahezu alle Parameter für jedes Token aktiv waren, ist Olmo-core 3 von Grund auf für sparsame MoE-Designs konzipiert. Es ersetzt den früheren Ansatz des vollständig shardierten Data Parallelism durch ein System basierend auf Distributed Data Parallelism, wobei Experten resident auf GPUs gehalten werden, um wiederholtes Sammeln von Gewichten zu vermeiden.

Wie es funktioniert

Olmo-core 3 verteilt das Modell und seinen Trainingszustand über drei primäre Techniken auf die Hardware. Expert Parallelism verteilt die spezialisierten Komponenten auf verschiedene GPUs, sodass jedes Gerät nur einen Bruchteil des gesamten Expertenpools speichert. Pipeline Parallelism teilt die Modell-Layer auf GPU-Gruppen auf, was den Speicherbedarf pro Gerät reduziert. Ein verteilter Optimierer spart zusätzlich Speicher, indem er den Optimierer-Zustand über den Cluster verteilt, anstatt ihn auf jeder GPU zu replizieren.

Um den Kommunikations-Overhead zu minimieren, setzt das Framework mehrere Optimierungen ein. Rowwise Expert Parallelism platziert geroutete Daten direkt in die Eingangs-Puffer der Experten, was die Kosten für Daten-Umordnungen senkt. GPU-resident Routing hält Metadaten auf den Grafikprozessoren, sodass die CPU Arbeit in die Warteschlange stellen kann, ohne auf Datentransfers warten zu müssen. Zusätzlich kombinieren Grouped GEMM-Operationen viele kleine Berechnungen zu größeren Batches, was die Ausführungseffizienz der GPU verbessert.

Das System unterstützt zudem MXFP8, ein Numberformat mit geringerer Präzision, das Datenbewegungen und Berechnungskosten senkt. In Benchmarks auf NVIDIA B300 GPUs erhöhte die Aktivierung von MXFP8 den Trainingsdurchsatz im Vergleich zur BF16-Baseline um etwa 21 Prozent und reduzierte gleichzeitig die maximale aktive Speichernutzung. Diese Funktionen arbeiten zusammen, um Kompromisse zwischen Berechnungsgeschwindigkeit und Datenübertragungs-Latenz auszubalancieren.

Wichtige Details

  • Olmo-core 3 erreichte in Vorabtests auf acht NVIDIA B300 GPUs einen 2,7-mal höheren Durchsatz als sein Vorgänger.
  • Das Framework unterstützt Modelle mit über einer Billion Gesamtparametern, demonstriert in einem Test mit 58,36 Milliarden aktiven Parametern pro Token.
  • Die Verwendung der MXFP8-Präzision verbesserte den Durchsatz um 21 Prozent und reduzierte den Spitzen-Speicherbedarf in kontrollierten Benchmarks von 103 GiB auf 95 GiB.
  • Das System identifiziert ein Phänomen namens "Token Gerrymandering", bei dem sich Routing-Scores verbessern, obwohl die Arbeitslast-Balance schlechter wird.
  • Das Überlappen von Kommunikation und Berechnung auf separaten GPU-Streams führte nicht immer zu einer Geschwindigkeitssteigerung und verlangsamte die Ausführung manchmal sogar.
  • Das Senken der Lernraten für Experten führte bei den getesteten Modellfamilien nicht zu besseren Ergebnissen, entgegen einigen gängigen Annahmen.

Warum das wichtig ist

Für Engineering-Teams, die großskalige KI-Systeme bauen, bietet Olmo-core 3 eine transparente Alternative zu proprietären Trainings-Stacks wie NVIDIAs Megatron-Core. Indem Hugging Face die Infrastruktur hinter seinen Modellen der nächsten Generation open-sourct, ermöglicht es Forschern und kleineren Labors, mit MoE-Architekturen zu experimentieren, ohne in spezifische Vendor-Ökosysteme eingebunden zu sein. Diese Transparenz ist entscheidend, um die realen Leistungsmerkmale von Sparse-Modellen zu verstehen.

Die technischen Erkenntnisse im Release heben wichtige Fallstricke für Entwickler hervor. Zum Beispiel stellt die Entdeckung, dass das Überlappen von Kommunikation und Berechnung die Leistung manchmal verschlechtern kann, Standard-Optimierungsheuristiken infrage. Ebenso deutet die Beobachtung, dass Eingabewerte die Berechnungszeit beeinflussen, selbst wenn die Matrixdimensionen konstant bleiben, darauf hin, dass Benchmarks sorgfältig durchgeführt werden müssen. Diese Einsichten helfen Ingenieuren, kostspielige Fehlkonfigurationen beim Skalieren ihrer eigenen Modelle zu vermeiden.

Was Sie tun können

  • Lesen Sie den technischen Bericht zu Olmo-core 3, um die spezifischen Ablationen und Designentscheidungen während der Entwicklung zu verstehen.
  • Experimentieren Sie mit dem Open-Source-Code auf GitHub, um MoE-Trainingskonfigurationen auf Ihrer eigenen Hardware zu testen.
  • Nutzen Sie das interaktive Walkthrough von Hugging Face, um zu visualisieren, wie Data-, Expert- und Pipeline-Parallelismus interagieren.
  • Benchmarken Sie Ihren aktuellen Trainings-Stack gegen die gemeldeten Metriken und stellen Sie sicher, dass Sie die Eingabewerte für faire Vergleiche angleichen.
  • Untersuchen Sie die Auswirkungen der MXFP8-Präzision auf Ihre spezifische Workload, um festzustellen, ob der Konvertierungs-Overhead den Durchsatzgewinn rechtfertigt.
  • Achten Sie in Ihren Routing-Metriken auf "Token Gerrymandering", um sicherzustellen, dass Load-Balancing-Scores die tatsächliche Arbeitslastverteilung widerspiegeln.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

Alle Artikel