オープン&ローカルAI

Olmo-core 3、混合専門家(MoE)学習を1兆パラメータ規模へスケール

Hugging Faceがオープンインフラ「Olmo-core 3」を公開。MoE学習のスループットを向上させ、総パラメータ数1兆を超えるモデルに対応します。

英語の原文から自動翻訳されました。

Hugging Faceは、大規模言語モデルの学習向けオープンソースフレームワークである「Olmo-core 3」の主要なアップデート版をリリースしました。2026年10月1日に公開されたこのバージョンでは、混合専門家(Mixture-of-Experts: MoE)アーキテクチャに特化して最適化された再設計システムが導入され、1兆パラメータ規模への効率的なスケーリングが可能になりました。

何が起きたか

今回のリリースは、現代のAI開発における重大なボトルネック、すなわち巨大モデルの学習に伴う高コストとエネルギー消費の問題に対処しています。MoEモデルは、各入力に対してパラメータの一部のみをアクティブにすることで理論上の効率性を実現しますが、GPUクラスタ間でこれらの専門家を調整するオーバーヘッドにより、その利点が損なわれることがしばしばあります。Olmo-core 3は、学習時のデータおよびモデル重みの分散方法を根本から見直すことで、このギャップを埋めることを目指しています。

社内ベンチマークでは、新フレームワークは著しいパフォーマンス向上を示しました。トークンあたりのアクティブパラメータ数を約32億に固定したまま、専門家プールを8から128に増やした場合、総パラメータ容量は46億から470億へと拡大しました。モデルサイズがこのように大幅に増加したにもかかわらず、学習スループットの低下は5%未満にとどまりました。また、このインフラは総パラメータ数1兆を超える規模でもテスト済みです。

この進化は、以前のイテレーションからの転換点を示しています。Olmo 3ではほぼすべてのパラメータが全トークンでアクティブになる密な(Dense)アーキテクチャを採用していましたが、Olmo-core 3はスパースなMoE設計のためにゼロから構築されています。従来の完全シャードデータ並列アプローチに代わり、分散データ並列に基づくシステムを導入し、専門家をGPU上に常駐させることで、重みの繰り返し収集を回避しています。

仕組み

Olmo-core 3は、主に3つの技術を用いてモデルとその学習状態をハードウェア全体に分散させます。専門家並列処理(Expert Parallelism)により、専門的なコンポーネントを異なるGPUに分散させ、各デバイスは専門家プールの一部のみを保存します。パイプライン並列処理(Pipeline Parallelism)は、モデル層をGPUグループ間に分割し、デバイスごとのメモリ要件を削減します。さらに、分散オプティマイザは、オプティマイザの状態を各GPUに複製するのではなくクラスタ全体に分散させることで、メモリ使用量を節約します。

通信オーバーヘッドを最小限にするため、フレームワークはいくつかの最適化手法を採用しています。行方向専門家並列処理(Rowwise Expert Parallelism)は、ルーティングされたデータを直接専門家の入力バッファに配置し、データの再配置コストを削減します。GPU常駐型ルーティング(GPU-resident routing)は、メタデータをグラフィックプロセッサ上に保持し、CPUがデータ転送を待たずに作業をキューイングできるようにします。加えて、グループ化GEMM演算により、多数の小規模な計算を大きなバッチに統合し、GPUの実行効率を高めます。

本システムは、データ移動および計算コストを削減する低精度数値フォーマット「MXFP8」もサポートしています。NVIDIA B300 GPUでのベンチマークでは、BF16ベースラインと比較してMXFP8の有効化により学習スループットが約21%向上し、ピークアクティブメモリ使用量も減少しました。これらの機能は、計算速度とデータ転送遅延のトレードオフをバランスさせるために連携して動作します。

主要な詳細

  • Olmo-core 3は、8台のNVIDIA B300 GPUを用いた予備テストにおいて、先行バージョン比で2.7倍の高いスループットを達成しました。
  • フレームワークは、トークンあたり583.6億のアクティブパラメータを持つテストを通じて、総パラメータ数1兆を超えるモデルをサポートしていることを実証しました。
  • MXFP8精度の使用により、制御されたベンチマークでスループットが21%向上し、ピークメモリが103 GiBから95 GiBに削減されました。
  • システムは、「トークンゲリマンダリング」と呼ばれる現象を検出しました。これは、ワークロードのバランスが悪化しているにもかかわらず、ルーティングスコアが改善されるというものです。
  • 個別のGPUストリーム上で通信と計算を重複(オーバーラップ)させても、必ずしも速度が上がらず、場合によっては実行が遅くなることがありました。
  • テストされたモデルファミリーでは、専門家の学習率を下げて結果が改善されることはなく、一般的な想定とは異なることが明らかになりました。

なぜ重要なのか

大規模AIシステムを構築するエンジニアリングチームにとって、Olmo-core 3は、NVIDIAのMegatron-Coreなどのプロプライエタリな学習スタックに対する透明性の高い代替手段を提供します。次世代モデルを支えるインフラをオープンソース化することで、Hugging Faceは研究者や小規模ラボが特定のベンダーエコシステムにロックインされることなく、MoEアーキテクチャを実験できる環境を整えています。この透明性は、スパースモデルの実世界のパフォーマンス特性を理解するために不可欠です。

リリースに含まれる技術的知見は、開発者にとって重要な落とし穴を浮き彫りにしています。例えば、通信と計算の重複が時にパフォーマンスを低下させるという発見は、標準的な最適化ヒューリスティックに挑戦するものです。同様に、行列の次元が一定であっても入力値が計算時間に影響するという観察結果は、ベンチマーク実施には細心の注意が必要であることを示唆しています。これらの洞察は、エンジニアが自社モデルをスケールさせる際に、コストのかかる誤設定を避ける助けとなります。

できること

  • Olmo-core 3の技術レポートを確認し、開発中に実施された具体的なアブレーション実験や設計選択を理解してください。
  • GitHub上のオープンソースコードを実験し、自身のハードウェアでMoE学習構成をテストしてください。
  • Hugging Faceが提供するインタラクティブなウォークスルーを活用し、データ並列、専門家並列、パイプライン並列がどのように相互作用するかを可視化してください。
  • レポートされた指標に基づき、現在の学習スタックをベンチマークしてください。公平な比較のために、入力値を一致させることを確認してください。
  • 特定のワークロードにおけるMXFP8精度の影響を調査し、変換オーバーヘッドがスループット向上に見合う価値があるかどうかを判断してください。
  • ルーティングメトリクス内で「トークンゲリマンダリング」を監視し、負荷分散スコアが実際のワークロード分布を反映していることを確認してください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

オープン&ローカルAI

Bespoke Labs、ローカル推論向け高速9B意思決定モデル「Nimble」をリリース

Bespoke Labsは、Qwen3.5-9Bからファインチューニングされたオープンウェイトの9B意思決定モデル「Nimble」をリリースしました。このモデルは、ローカルハードウェア上で100ミリ秒未満で構造化された質問に対する確率的な回答を提供します。

オープン&ローカルAI

Raspberry Pi 5でLiteRTを使いGemma LLMを実行する

Googleの2026年ガイドでは、LiteRTを使用してRaspberry Pi 5上でGemmaモデルを実行し、クラウド依存なしでロボティクスやエッジエージェント向けのリアルタイム推論を実現する方法が詳細に説明されています。

すべての記事