Reflection AI、推論用の低コストオープンウェイトモデル「Beam」を発表
Reflection AIは、中国の競合他社と同等の推論性能を大幅に少ない推論計算リソースで実現すると主張するオープンウェイトモデル「Beam」を発表しました。
英語の原文から自動翻訳されました。
2024年にブルックリンで設立されたスタートアップ企業であるReflection AIは、同社初のフロンティア級オープンウェイト人工知能モデル「Beam」を正式にリリースしました。この発表は、大規模言語モデルという激しい競争環境への重要な参入であり、クローズドソースシステムや、中国および西側諸国の既存のオープンウェイトオプションに対するコスト効率の良い代替品としてBeamを位置付けています。
何が起きたか
同社はBeamを、高度な推論、コーディング、エージェント型タスク専用に設計されたテキストのみ対応のMixture-of-Experts(MoE)モデルと説明しています。Reflectionによれば、このモデルは複雑なベンチマークにおいて中国の主要なオープンモデルと同等のパフォーマンスを発揮しますが、競合他社が要求するトークンコストと推論時間計算量のわずか一部で動作します。この発表により、同スタートアップが一般公開間近であるとの以前の報道が裏付けられました。
Beamは総パラメータ数5,010億個を持ち、推論時には230億個のパラメータがアクティブになります。23.8兆トークンの巨大データセットで事前学習され、100万トークンのコンテキストウィンドウをサポートしています。比較のために言えば、Z.aiのGLM-5.2モデルは総パラメータ数が約7,440億個で、アクティブパラメータ数は400億個です。Reflectionは、自社のパフォーマンス指標はまだ独立した検証を受けていないものの、内部ベンチマークではBeamがGLM-5.2と同等のスコアを出し、現在の西側の主要なオープンモデルを上回っていることを示していると主張しています。
同スタートアップは、Anthropic、OpenAI、Mistral、Meta、Cohereなどの主要プレイヤーに対してBeamを直接対抗させようとしています。最も直接的な国内競合相手は、Thinking Machines Labが7月にリリースしたオープンモデル「Inkling」かもしれません。Reflectionのデータによると、Beamは4つの特定のコーディングテストでInklingより高得点を出していますが、Inklingがマルチモーダルである一方、Beamはテキストのみに対応している点に注意が必要です。同社は今月中にモデルの重みと完全な技術詳細を公開する予定で、ハイパースケーラー、ネオクラウド、オープンソースライブラリを通じて配布を行う計画です。
仕組み
BeamはMixture-of-Expertsアーキテクチャを採用しており、この設計により、モデルは任意の入力に対して総パラメータの一部のみをアクティブ化できます。このスパース性により、モデルは知識保持のために高い総パラメータ数を維持しつつ、運用中のアクティブパラメータ数を低く抑えることができます。その結果、推論時の計算負荷が軽減され、Reflectionによれば、競合他社と比較して推論計算の使用量が3〜4分の1に削減されるとのことです。
このモデルは、高計算量のリインフォースメントラーニング(強化学習)手法を用いて訓練されました。この訓練アプローチは、単に次の単語を予測するだけでなく、複雑な問題を推論する能力を最適化することに焦点を当てています。推論能力を優先することで、従来の事前学習方法だけでは可能だったよりも、エージェント型タスクやコーディング課題をより効果的に処理することを目指しています。
主要な詳細
- Beamは総パラメータ数5,010億個のモデルで、推論ステップごとに230億個のアクティブパラメータを使用します。
- モデルは23.8兆トークンで事前学習され、100万トークンのコンテキストウィンドウをサポートします。
- Reflectionは、推論ベンチマークでの性能を競合モデルと同等に保ちながら、推論計算量を3〜4分の1に削減できると主張しています。
- 同スタートアップはNvidia、Sequoia Capital、Lightspeed Venture Partnersなどを支援者として、約47億ドルを調達しました。
- ReflectionはSpaceXおよびNebiusとの取引で70億ドル以上を確保し、2029年までNvidia GB300チップへのアクセスを得ています。
- 同社は「AIファクトリー」という概念を推進しており、企業や主権国家が独自データ上でカスタマイズされたローカルAIシステムを訓練できるようにしています。
なぜ重要なのか
ソフトウェアエンジニアや技術リーダーにとって、推論コストの低下という約束は極めて重要です。AIアプリケーションが実験的なプロトタイプから本番環境へ移行するにつれ、大規模モデルの実行コストは prohibitively(実行不可能なほど)高くなる可能性があります。フロンティアレベルの推論機能を大幅に低い計算コストで提供するモデルは、より幅広い製品やサービスにおいて高度なAI機能を実用的なものにするかもしれません。この効率性の向上は、特に遅延とコストが主な制約となるエージェント型ワークフローや複雑なコーディングアシスタントを構築しているチームにとって関連性が高いです。
さらに、このリリースは西側と中国のオープンウェイトモデル間の競争を激化させています。コスト効率の良い性能のために中国のラボのモデルに依存してきた開発者は、現在、同様の効率性を主張する国内の代替案を持っています。この多様化により、基盤となるAIインフラのための単一の地理的領域への依存度が低下します。また、他の西側プロバイダーにも自社のモデルを効率化するために圧力をかけ、業界全体におけるスパースアーキテクチャや強化学習訓練手法のイノベーションを加速させる可能性があります。
あなたができること
- 今月中のBeamの重みと技術文書の公式リリースを監視し、現在のインフラとの互換性を評価してください。
- これらの数値は現在自己申告によるものであることを念頭に置き、具体的なワークロード要件に対して主張されている推論計算量の3〜4分の1削減を評価してください。
- アプリケーションで画像や音声処理をテキスト推論と並行して必要とする場合、Inklingのようなマルチモーダル代替案に対してBeamのテキストのみ対応の能力を比較検討してください。
- 組織が機密性の高い独自データを扱い、公開APIに頼るのではなく、ローカライズされたカスタマイズされたAIシステムを必要とする場合は、「AIファクトリー」コンセプトについて調査してください。
- ハイパースケーラーやネオクラウドとの統合オプションを確認し、チームにとって最もコスト効率の良いデプロイ戦略を決定してください。
- Reflectionのパフォーマンス主張が確立された標準に対して検証されるよう、独立したベンチマーク結果が出次第、注視してください。



