オープン&ローカルAI

Mistral AI、効率的な訓練で1兆パラメータモデルを公開

フランスのAI研究所Mistral AIは、4,000台のGPUで訓練された1兆パラメータのマルチモーダルモデル「Mistral Large 4」を発表しました。オープンウェイト版は3週間後にリリースされる予定です。

A glass cube with glowing circuits next to technical notes and a chip.
この記事用に生成されたイラスト

英語の原文から自動翻訳されました。

フランスのAI研究所Mistral AIは、米国や中国の競合他社に対抗するために設計された新しい大型マルチモーダルモデル「Mistral Large 4」(ML4)を正式に発表しました。火曜日のこの発表は、グローバルな人工知能競争において欧州発の代替案を提供するという同社の戦略における重要な一歩を示しています。

何が起きたのか

その巨大な規模(1兆パラメータ)から社内では「Le Chonk」というニックネームで呼ばれる新モデルは、Mistralの能力における大幅な拡張を表しています。これまでの小規模なイテレーションとは異なり、今回のリリースは大規模言語モデルのフロンティアを目指しており、主要なテクノロジー企業による現在のクローズドソース製品に匹敵するか、それを超えるパフォーマンスを提供することを目指しています。同社はML4をAI開発における「第三の道」として位置付けており、米国の企業の完全な閉鎖型エコシステムや、主に中国から出現しているオープンウェイトモデルとは区別されています。

現在、ML4はすぐにオープンウェイトとしてダウンロードできるわけではありません。代わりに、必要な安全テストが完了するまでの間、パブリックガードレールエンドポイントを通じてアクセス可能となっています。Mistralは、これらのセキュリティ監査の完了を待って、3週間後に完全なモデルウェイトをリリースすると発表しました。この段階的なアプローチにより、チームは信頼できるパートナーや政府機関と協力し、広範な配布の前に悪意ある使用に対して技術が堅牢であることを確認できます。

Mistralの科学担当副社長であるPierre Stock氏は、エンタープライズおよび機関クライアントの間で高まるセキュリティ懸念に対応するため、遅延は意図的であると強調しました。初期アクセスを制御することで、同社はオープンウェイトの透明性という利点と、責任あるデプロイメントの必要性とのバランスを取ろうとしています。Stock氏は、オープンウェイトモデルは本質的に監査が容易であり、検証可能なセキュリティ基準を必要とするコア顧客層のニーズに沿っていると指摘しました。

仕組み

ML4の特徴的な点は、その訓練効率です。このモデルはMistral独自の計算インフラストラクチャのみを使用して完全に訓練され、Nvidia GPUはわずか4,000台しか利用されていません。Stock氏によると、このハードウェアフットプリントは中国の競合他社が使用する量の2〜3分の1であり、同規模のモデルに対してクローズドソースの競合他社が通常採用する量よりも大幅に少ないということです。これは訓練パイプラインにおける高度な最適化を示唆しており、Mistralがより少ないリソースで競争力のある結果を達成できることを意味します。

このモデルはマルチモーダルであり、テキストや画像など異なる種類のデータを処理・生成できるため、複雑な技術ワークフローにおいて価値を追加します。Mistralは、これらの機能が重要となる特定のハイバリュードメインに訓練を集中させています。同社はサイバーセキュリティ、金融、チップ設計を主な最適化ユースケースとして挙げています。この専門性は、ASMLやSamsungなどの業界リーダーからの戦略的な支援によって支えられており、彼らはMistralの成長に多大な投資を行い、自社の半導体製造プロセスにおいて高度なAIに依存しています。

主要な詳細

  • Mistral Large 4は1兆パラメータを含み、「Le Chonk」というニックネームを獲得しました。
  • モデルはわずか4,000台のNvidia GPUを使用して訓練され、競合他社が使用する計算量のほんの一部にとどまりました。
  • オープンウェイトは、安全テストと政府との協力の後、3週間後にリリースされます。
  • 現在のアクセスは、監査フェーズ中の悪意ある使用を防ぐために、パブリックガードレールエンドポイントに限定されています。
  • ASMLやSamsungからの投資家の関心を反映し、最適化されたユースケースにはサイバーセキュリティ、金融、チップ設計が含まれます。
  • Mistralは、特に中国以外において、ML4が世界中のオープンウェイトモデルの中で最高クラスになることを目指しています。

なぜ重要なのか

ソフトウェアエンジニアや技術リーダーにとって、ML4のリリースは、より効率的かつ特化した基盤モデルへのシフトを示しています。比較的小さなGPUクラスタで1兆パラメータのモデルを訓練できる能力は、総当たり的な計算力がフロンティア性能への唯一の道ではないことを実証しています。この効率性は、最も高価なクラウドインフラストラクチャプロバイダーに exclusively 依存せずに大規模モデルのファインチューニングやデプロイを検討している企業にとって、参入障壁を下げる可能性があります。

オープンウェイトの段階的なリリースは、AIコミュニティにおける重要な緊張関係、つまり透明性への欲求と誤用リスクとの対立にも対処しています。ウェイトをリリースする前にセキュリティ監査と政府との協力を優先することで、Mistralは責任あるオープンソース開発の前例を作っています。このアプローチは、監査可能性と安全性が新しいAI技術を採用するための交渉不可な要件である金融やヘルスケアなどの規制産業にとって魅力的かもしれません。

さらに、チップ設計とサイバーセキュリティへの焦点は、イノベーションのためにAIへの依存度を高めているハードテックセクターとML4を整合させます。これらの分野で働く開発者にとって、ドメイン向けに特別に最適化されたモデルを持つことは、広範なカスタム訓練の必要性を減らし、製品開発サイクルを加速させる可能性があります。ASMLやSamsungのようなハードウェア大手による支援は、産業応用におけるモデルの潜在的有用性をさらに裏付けています。

できること

  • パブリックガードレールエンドポイントを監視し、あなたの特定のドメインでML4のマルチモーダル機能をテストしてください。
  • ストレージおよび計算要件を評価することで、3週間後のオープンウェイトリリースに向けてインフラストラクチャを準備してください。
  • MistralがML4に適用している監査基準に合わせて、現在のAIセキュリティプロトコルを見直してください。
  • マルチモーダル入力が既存のワークフローを強化できる可能性があるサイバーセキュリティ、金融、またはチップ設計でのユースケースを探ってください。
  • 信頼できる機関がどのようにモデルを安全に統合しているかを理解するために、Mistralのパートナーエコシステムに参加してください。
  • ベンチマーク結果が公開されたら最新情報を入手し、他のオープンウェイトモデルと比較してML4のパフォーマンスを確認してください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

すべての記事