EmbeddingGemma 2、消費者向けハードウェアでマルチモーダル検索を実現
GoogleがEmbeddingGemma 2をリリースしました。これはテキスト、コード、音声、ビデオの埋め込みを統合する軽量なオープンモデルで、デバイス上での効率的な検索を可能にします。
英語の原文から自動翻訳されました。
Googleは、デバイス上での効率的な推論を目的としたオープンウェイトのマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開しました。2026年10月6日に発表されたこのアップデートにより、当初はテキストのみに対応していたアーキテクチャが拡張され、共有された埋め込み空間内でコード、画像、ビデオ、音声をネイティブにサポートするようになりました。本モデルは、クラウドAPIに依存せず、プライバシー重視の検索拡張生成(RAG)パイプラインを消費者向けハードウェア上で直接実現することを目指しています。
何が起きたか
初代のEmbeddingGemmaモデルは、ローカル検索ツールやプライベートRAGシステムを開発するエンジニアによって2,000万回以上ダウンロードされました。この需要に応える形で、Google DeepMindのリサーチャーであるSahil Dua氏とHenrique Schechter Vera氏は、複雑なマルチモーダルデータを処理するためのEmbeddingGemma 2を導入しました。Gemma 4アーキテクチャに基づいて構築された新モデルは7億4,000万のパラメータを持ち、商用利用も可能なApache 2.0ライセンスの下で公開されています。これにより、エンジニアはデータ処理を完全にオフラインのまま維持しつつ、アプリケーションに高品質なセマンティック検索を組み込むことができます。
EmbeddingGemma 2は、パラメータ数が10億未満のマルチモーダル埋め込みモデルの中でトップクラスの性能スコアを達成しています。Massive Text Embedding Benchmark (MTEB) CodeやMassive Audio Embedding Benchmark (MAEB)などのベンチマークにおいて、テキスト、ビジョン、音声の各分野でより大型の専門モデルに匹敵するか、それを上回る性能を示しています。これらのモダリティを統合することで、ボイスメモを使って特定のビデオクリップを検索したり、テキストクエリで長時間の録音データを検索したりといったタスクが可能になります。この機能は単一のモデルで処理されるため、メディアタイプごとに個別のエンコーダーを用意する必要がありません。
仕組み
本モデルはモジュール式設計を採用しており、開発者は必要なコンポーネントのみを読み込むことができます。テキスト専用のワークロードでは2億7,000万のパラメータのみが必要ですが、オプションのビジョンおよび音声エンコーダーを追加すると、それぞれ1億7,000万と3億のパラメータが増加します。このモジュール性により、完全なマルチモーダルサポートが必要ない場合でも、アプリケーションを軽量に保つことが可能です。ストレージ効率のため、Matryoshka Representation Learning (MRL) が採用されています。この技術により、出力ベクトルを768次元から512、256、または128次元へ動的に切り詰めることができます。このようなベクトルの切り詰めにより、ローカルベクトルデータベースのストレージ要件を最大6分の1まで削減できます。
パフォーマンス最適化はアーキテクチャの中核を成しています。量子化を用いることで、フルマルチモーダルモデルはGoogle Pixel 11 Pro上で約567MBのアクティブRAMを必要とし、テキスト専用バージョンでは約191MBで済みます。また、本モデルは8Kトークンのコンテキストウィンドウを備えており、これは前世代の4倍のサイズです。この拡張されたコンテキストにより、システムは一度のパスで最大5.5分の音声、29枚の画像、または58フレームのビデオを処理できます。テキストトークナイザーと音声エンコーダーをGemma 4と共有しているため、開発者は両モデルを統一されたパイプラインで実行し、合計メモリフットプリントを抑えることができます。
主要な詳細
- パラメータ数: 合計7億4,000万。テキスト(2億7,000万)、ビジョン(1億7,000万)、音声(3億)用のモジュール式コンポーネントを含みます。
- ライセンス: Apache 2.0。商用利用および変更が可能です。
- コンテキストウィンドウ: 8Kトークン。最大5.5分の音声または58フレームのビデオをサポートします。
- ストレージ効率: Matryoshka Representation Learningにより、ベクトルを768次元から128次元へ切り詰め、ストレージを最大6倍節約できます。
- パフォーマンス: MTEB Codeにおけるコード埋め込みスコアが、前バージョンと比較して9.92ポイント向上しました。
- ハードウェア要件: 消費者向けデバイスで動作し、Pixel 11 Pro上のフルマルチモーダルモデルには約567MBのRAMが必要です。
なぜ重要なのか
検索およびリトリーバルシステムを構築するソフトウェアエンジニアにとって、今回のリリースは機密データを外部クラウドサービスへ送信する必要性を排除します。埋め込みをローカルで処理することでデータのプライバシーが確保され、リアルタイムアプリケーションにとって重要なレイテンシが低減されます。エッジハードウェア上で複雑なマルチモーダル検索を実行できる能力により、モバイルアプリやデスクトップツールは、常にインターネット接続がある状態ではなくとも、洗練されたセマンティック理解を提供できるようになります。これは、厳格なコンプライアンス要件を持つ業界や、低帯域幅環境にいるユーザーにとって特に価値があります。
コード埋め込み性能の向上により、本モデルはローカルコードベースのインデックス作成やセマンティックコード検索にも非常に適しています。開発者は、ローカルリポジトリから関連するスニペットやドキュメントを直接取得するコーディングエージェントを構築できます。小さなフットプリントを維持しながら、はるかに大型のモデルに匹敵する品質を実現することで、EmbeddingGemma 2は高度なAI機能を構築する際の参入障壁を下げています。これにより、チームは高価なGPUインフラストラクチャを管理することなく、堅牢なRAGパイプラインのプロトタイプ作成と展開が可能になります。
できること
- Hugging FaceまたはKaggleからモデルの重みをダウンロードし、ローカル推論の実験を開始してください。
- LiteRTまたはMediaPipeを使用して、ターンキー方式の埋め込みおよびリトリーバルタスクを含むクロスプラットフォームアプリを展開してください。
- Qdrant或其他互換性のあるデータベースを使用してベクトルストレージを実装し、切り詰められたベクトル次元を活用してください。
- Unslothが提供するガイダンスを利用して、特定のユースケース向けにモデルをファインチューニングしてください。
- transformers.jsまたはWebGPUを使用して、クライアントサイドのセマンティック検索を行うブラウザベースのアプリケーションを構築してください。



