Développer avec l’IA

EmbeddingGemma 2 apporte la recherche multimodale au matériel grand public

Google lance EmbeddingGemma 2, un modèle ouvert léger qui unifie les embeddings de texte, de code, d'audio et de vidéo pour une récupération efficace sur l'appareil.

A glass cube with multimodal data layers on a desk beside a smartphone
Illustration générée pour cet article

Traduit automatiquement depuis l'original anglais.

Google a publié EmbeddingGemma 2, un modèle d'embedding multimodal à poids ouverts conçu pour une inférence efficace directement sur l'appareil. Lancée le 6 octobre 2026, cette mise à jour étend l'architecture initiale, limitée au texte, pour prendre en charge nativement le code, les images, la vidéo et l'audio dans un espace d'embedding partagé. Le modèle vise à permettre des pipelines de génération augmentée par récupération (RAG) respectueux de la vie privée directement sur le matériel grand public, sans dépendre des API cloud.

Ce qui s'est passé

Le premier modèle EmbeddingGemma a enregistré plus de 20 millions de téléchargements de la part de développeurs créant des outils de recherche locaux et des systèmes RAG privés. En réponse à cette demande, les chercheurs de Google DeepMind Sahil Dua et Henrique Schechter Vera ont introduit EmbeddingGemma 2 pour gérer des données multimodales complexes. Construit sur l'architecture Gemma 4, le nouveau modèle contient 740 millions de paramètres et est publié sous la licence Apache 2.0, commercialement permissive. Cela permet aux ingénieurs d'intégrer une recherche sémantique de haute qualité dans leurs applications tout en gardant le traitement des données entièrement hors ligne.

EmbeddingGemma 2 atteint des scores de performance leaders parmi les modèles d'embedding multimodaux de moins d'un milliard de paramètres. Il égale ou surpasse des modèles spécialisés plus volumineux sur les benchmarks de texte, de vision et d'audio, notamment le Massive Text Embedding Benchmark (MTEB) Code et le Massive Audio Embedding Benchmark (MAEB). En unifiant ces modalités, le modèle permet des tâches telles que trouver des clips vidéo spécifiques à partir de mémos vocaux ou rechercher des heures d'enregistrements audio avec des requêtes textuelles. Cette capacité est traitée par un seul modèle plutôt que de nécessiter des encodeurs séparés pour chaque type de média.

Comment cela fonctionne

Le modèle utilise une conception modulaire qui permet aux développeurs de ne charger que les composants dont ils ont besoin. Une charge de travail uniquement textuelle nécessite seulement 270 millions de paramètres, tandis que les encodeurs optionnels de vision et d'audio ajoutent respectivement 170 millions et 300 millions de paramètres. Cette modularité garantit que les applications restent légères si elles n'ont pas besoin d'un support multimodal complet. Pour l'efficacité du stockage, le modèle utilise l'apprentissage de représentation Matryoshka (MRL). Cette technique permet aux développeurs de tronquer dynamiquement les vecteurs de sortie de 768 dimensions à 512, 256 ou 128 dimensions. Tronquer les vecteurs de cette manière peut réduire les besoins de stockage pour les bases de données vectorielles locales jusqu'à six fois.

L'optimisation des performances est centrale dans l'architecture. Avec la quantification, le modèle multimodal complet nécessite environ 567 Mo de RAM active sur un Google Pixel 11 Pro, tandis que la version uniquement textuelle n'en nécessite qu'environ 191 Mo. Le modèle dispose également d'une fenêtre de contexte de 8K tokens, quatre fois plus grande que celle de son prédécesseur. Ce contexte étendu permet au système de traiter jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo en une seule passe. Comme il partage le tokenizer texte et l'encodeur audio avec Gemma 4, les développeurs peuvent exécuter les deux modèles ensemble dans un pipeline unifié avec une empreinte mémoire combinée réduite.

Détails clés

  • Nombre de paramètres : 740 millions au total, avec des composants modulaires pour le texte (270 M), la vision (170 M) et l'audio (300 M).
  • Licence : Apache 2.0, autorisant l'utilisation commerciale et la modification.
  • Fenêtre de contexte : 8K tokens, supportant jusqu'à 5,5 minutes d'audio ou 58 images vidéo.
  • Efficacité de stockage : L'apprentissage de représentation Matryoshka permet la troncature des vecteurs de 768 à 128 dimensions, économisant jusqu'à 6x de stockage.
  • Performance : Améliore les scores d'embedding de code de 9,92 points sur MTEB Code par rapport à la version précédente.
  • Exigences matérielles : Fonctionne sur des appareils grand public, nécessitant ~567 Mo de RAM pour le modèle multimodal complet sur un Pixel 11 Pro.

Pourquoi c'est important

Pour les ingénieurs logiciels construisant des systèmes de recherche et de récupération, cette publication élimine la nécessité d'envoyer des données sensibles vers des services cloud externes. Le traitement local des embeddings assure la confidentialité des données et réduit la latence, ce qui est crucial pour les applications en temps réel. La capacité d'exécuter une recherche multimodale complexe sur du matériel edge signifie que les applications mobiles et les outils de bureau peuvent offrir une compréhension sémantique sophistiquée sans connectivité Internet constante. C'est particulièrement précieux pour les industries ayant des exigences strictes de conformité ou pour les utilisateurs dans des environnements à faible bande passante.

L'amélioration des performances d'embedding de code rend également ce modèle très adapté à l'indexation locale de bases de code et à la recherche sémantique de code. Les développeurs peuvent construire des agents de codage qui récupèrent des extraits pertinents ou de la documentation directement depuis leurs dépôts locaux. En égalant la qualité de modèles beaucoup plus grands tout en maintenant une petite empreinte, EmbeddingGemma 2 abaisse la barrière à l'entrée pour la construction de fonctionnalités IA avancées. Il permet aux équipes de prototyper et de déployer des pipelines RAG robustes sans gérer d'infrastructure GPU coûteuse.

Ce que vous pouvez faire

  • Téléchargez les poids du modèle depuis Hugging Face ou Kaggle pour commencer à expérimenter avec l'inférence locale.
  • Utilisez LiteRT ou MediaPipe pour déployer des applications multiplateformes avec des tâches d'embedding et de récupération prêtes à l'emploi.
  • Implémentez le stockage vectoriel en utilisant Qdrant ou d'autres bases de données compatibles pour tirer parti des dimensions de vecteurs tronquées.
  • Affinez le modèle pour des cas d'usage spécifiques en suivant les directives fournies par Unsloth.
  • Construisez des applications basées sur navigateur en utilisant transformers.js ou WebGPU pour la recherche sémantique côté client.
  • Combinez EmbeddingGemma 2 avec d'autres outils pour créer des solutions complètes.

Outils de la Boutique Bytechap

Continuer la lecture

Tous les articles