Cohere Embed 5 sépare l'indexation et la requête pour réduire la latence RAG
Cohere a lancé Embed 5, permettant aux développeurs d'indexer avec un modèle Pro de haute qualité et d'effectuer des requêtes avec un modèle Fast plus rapide dans le même espace vectoriel.
Traduit automatiquement depuis l'original anglais.
Cohere a lancé Embed 5 mercredi, introduisant une architecture à double modèle qui dissocie l'indexation des données de l'exécution des requêtes. Cette mise à jour permet aux équipes d'ingénierie d'utiliser Embed 5 Pro, à la fidélité supérieure, pour construire les index vectoriels tout en servant les requêtes en direct avec Embed 5 Fast, moins coûteux et à débit plus élevé, sans avoir à maintenir des structures de données distinctes.
Ce qui s'est passé
L'innovation majeure de cette version réside dans l'espace d'embedding partagé entre les deux modèles. Auparavant, passer à un modèle de requête plus efficace nécessitait souvent de ré-indexer l'intégralité du corpus ou de maintenir des index parallèles, ce qui doublait les coûts de stockage et la complexité opérationnelle. Avec Embed 5, les développeurs peuvent ingérer des documents via le modèle Pro afin de garantir une qualité de récupération élevée lors de la phase d'indexation. Lorsque le système traite les requêtes des utilisateurs, il bascule sur le modèle Fast, qui opère dans les mêmes dimensions vectorielles et selon les mêmes normes de compatibilité.
Les tests internes de Cohere indiquent que cette approche hybride entraîne une dégradation minimale de la qualité de récupération. Sur 40 jeux de données incluant du texte, des images, des documents fusionnés et des documents analysés, la combinaison d'une indexation Pro et de requêtes Fast a atteint un score relatif de 98,4 par rapport à une référence de 100 pour une utilisation Pro-versus-Pro. L'utilisation du modèle Fast pour l'indexation et les requêtes a fait chuter le score à 96,6. La société a noté qu'aucun jeu de données individuel n'a présenté de baisse majeure de performance lors de l'utilisation de la configuration mixte Pro-Fast.
Ce changement architectural répond à un goulot d'étranglement courant dans les systèmes de Génération Augmentée par Récupération (RAG) et les flux de travail agentiques. Dans ces systèmes, l'ingestion de données est peu fréquente, mais les requêtes de recherche se répètent et doivent être à faible latence. En optimisant le trafic intensif de requêtes avec le modèle Fast, les équipes peuvent réduire considérablement les temps de réponse et les coûts d'infrastructure sans sacrifier la précision établie lors de la phase d'indexation initiale.
Comment cela fonctionne
Embed 5 Pro et Fast produisent tous deux des vecteurs compatibles aux dimensions identiques, leur permettant de coexister dans le même index. Cette compatibilité s'étend aux techniques avancées de compression telles que la troncature Matryoshka et la quantification int8. Les développeurs peuvent choisir parmi six dimensions vectorielles allant de 256 à 2 048, et sélectionner les formats float32, int8 ou binaire selon leurs besoins en matière de stockage et de précision.
Les implications en termes de stockage sont substantielles pour les déploiements à grande échelle. Un vecteur standard float32 de 2 048 dimensions occupe 8 Ko, ce qui signifie qu'un corpus de 100 millions de fragments nécessiterait environ 819 Go. Passer à un vecteur int8 de 1 024 dimensions réduit cet encombrement à environ 102 Go. Pour une efficacité encore accrue, un vecteur binaire de 256 dimensions ramène le même jeu de données à environ 3,2 Go. Cohere recommande le format int8 de 1 024 dimensions pour la plupart des cas d'usage, car il équilibre les économies de mémoire avec une qualité de récupération proche de la pleine précision. Les représentations binaires sont suggérées pour les étapes de récupération initiales où la vitesse est critique, suivies d'un reclassement (reranking) à plus haute précision.
Les modèles prennent également en charge les entrées multimodales, y compris le texte, les images et les combinaisons fusionnées texte-image, dans plus de 100 langues. Ils disposent d'une fenêtre contextuelle de 128K jetons, leur permettant de traiter directement de grands documents ou des données visuelles complexes. Cette capacité permet l'embedding d'images de pages ou d'entrées combinées dans un seul vecteur, simplifiant la gestion de types de documents diversifiés dans les applications IA modernes.
Détails clés
- Embed 5 Pro coûte 0,12 $ par million de jetons, tandis qu'Embed 5 Fast coûte 0,08 $ par million de jetons.
- Le modèle Fast offre un débit moyen de documents 2,4 fois supérieur à celui du modèle Pro dans les tests de Cohere.
- L'indexation Pro avec requêtes Fast a obtenu un score de 98,4 par rapport à une référence Pro-versus-Pro de 100 sur 40 jeux de données.
- Les deux modèles prennent en charge six dimensions vectorielles de 256 à 2 048, avec des options de formats float32, int8 et binaire.
- Les modèles traitent le texte, les images et les entrées fusionnées dans plus de 100 langues avec une fenêtre contextuelle de 128K jetons.
- Embed 5 est disponible via l'API de Cohere, Model Vault, Microsoft Foundry, Amazon SageMaker, et prend en charge le déploiement VPC privé et sur site via vLLM.
Pourquoi c'est important
Pour les ingénieurs logiciels développant des systèmes RAG, la capacité de dissocier la qualité de l'indexation de la latence des requêtes constitue un avantage opérationnel significatif. La plupart des environnements de production sont dominés par la lecture, ce qui signifie que le coût et la vitesse des requêtes prédominent dans le coût total de possession. En utilisant un modèle moins cher et plus rapide pour le chemin de requêtes à haut volume, les équipes peuvent réduire les coûts API et améliorer l'expérience utilisateur sans la surcharge liée à la gestion de multiples index ou au retraitement des données.
Cependant, les résultats du benchmark comportent des réserves importantes. Cohere a évalué Embed 5 en utilisant RCP-nDCG@10, une métrique qui utilise des critères de pertinence spécifiques à la requête plutôt que des étiquettes fixes. Bien que cette méthode puisse identifier des résultats pertinents manqués par les benchmarks traditionnels, elle mesure le reclassement sur un ensemble de candidats fixe plutôt que la récupération de première étape sur l'intégralité du corpus. La récupération de première étape a été évaluée séparément en utilisant les métriques standard nDCG et Recall, ce qui signifie que les scores rapportés ne sont pas directement comparables entre tous les types d'évaluation.
Les équipes de production doivent valider ces constatations sur leurs propres données. Les erreurs de récupération dans les flux de travail agentiques peuvent s'accumuler à travers plusieurs étapes, entraînant des problèmes critiques en aval. Par conséquent, bien que la baisse moyenne du score soit faible, certains domaines ou motifs de requêtes peuvent se comporter différemment. Les ingénieurs devraient tester la configuration Pro-versus-Fast sur leur corpus spécifique et leur distribution de requêtes avant toute migration complète.
Ce que vous pouvez faire
- Testez votre pipeline RAG actuel en utilisant Embed 5 Pro pour l'indexation et Fast pour les requêtes afin de mesurer les gains de latence et de coûts.
- Évaluez l'impact des différentes dimensions vectorielles et formats de quantification sur vos coûts de stockage et votre précision de récupération.
- Testez les capacités multimodales en intégrant des images de pages ou des entrées fusionnées texte-image si votre application gère des types de documents diversifiés.
- Vérifiez votre infrastructure pour vous assurer qu'elle prend en charge l'option de déploiement choisie, telle que vLLM pour les configurations sur site ou VPC privées.
- Surveillez attentivement la qualité de récupération en production, surtout si votre flux de travail agentique implique plusieurs étapes de récupération séquentielles.
- Envisagez d'utiliser des vecteurs binaires pour les étapes de récupération initiales suivies d'un reclassement si les contraintes de stockage sont serrées.