Cohere Embed 5 separa la indexación de las consultas para reducir la latencia en RAG
Cohere ha lanzado Embed 5, que permite a los desarrolladores indexar con un modelo Pro de alta calidad y realizar consultas con un modelo Fast más rápido dentro del mismo espacio vectorial.
Traducido automáticamente del original en inglés.
Cohere lanzó Embed 5 el miércoles, introduciendo una arquitectura de doble modelo que separa la indexación de datos de la ejecución de consultas. Esta actualización permite a los equipos de ingeniería utilizar el modelo Embed 5 Pro de mayor fidelidad para construir índices vectoriales mientras atienden consultas en tiempo real con el modelo Embed 5 Fast, de menor costo y mayor rendimiento, todo ello sin necesidad de mantener estructuras de datos separadas.
Qué ha ocurrido
La innovación central de este lanzamiento es el espacio de incrustaciones compartido entre ambos modelos. Anteriormente, cambiar a un modelo de consulta más eficiente solía requerir reindexar todo el corpus o mantener índices paralelos, lo que duplicaba los costos de almacenamiento y la complejidad operativa. Con Embed 5, los desarrolladores pueden ingerir documentos utilizando el modelo Pro para garantizar una alta calidad de recuperación durante la fase de indexación. Cuando el sistema atiende las consultas de los usuarios, cambia al modelo Fast, que opera dentro de las mismas dimensiones vectoriales y estándares de compatibilidad.
Las pruebas internas de Cohere indican que este enfoque híbrido resulta en una degradación mínima de la calidad de recuperación. En 40 conjuntos de datos que incluían texto, imágenes, documentos fusionados y documentos analizados, la combinación de indexación Pro y consulta Fast alcanzó una puntuación relativa de 98,4 frente a una línea base de 100 para el uso de Pro a Pro. Utilizar el modelo Fast tanto para la indexación como para las consultas redujo aún más la puntuación a 96,6. La empresa señaló que ningún conjunto de datos individual mostró una caída significativa en el rendimiento al usar la configuración mixta Pro-Fast.
Este cambio arquitectónico aborda un cuello de botella común en los flujos de trabajo de Generación Aumentada por Recuperación (RAG) y agentes. En estos sistemas, la ingesta de datos ocurre con poca frecuencia, pero las consultas de búsqueda se repiten constantemente y deben tener baja latencia. Al optimizar el tráfico pesado de consultas con el modelo Fast, los equipos pueden reducir significativamente los tiempos de respuesta y los costos de infraestructura sin sacrificar la precisión establecida durante la fase inicial de indexación.
Cómo funciona
Tanto Embed 5 Pro como Fast producen vectores compatibles en dimensiones idénticas, lo que les permite coexistir en el mismo índice. Esta compatibilidad se extiende a técnicas avanzadas de compresión como la truncación Matryoshka y la cuantización int8. Los desarrolladores pueden elegir entre seis dimensiones vectoriales que van desde 256 hasta 2.048, y seleccionar entre formatos float32, int8 o binarios según sus requisitos de almacenamiento y precisión.
Las implicaciones de almacenamiento son sustanciales para implementaciones a gran escala. Un vector estándar float32 de 2.048 dimensiones ocupa 8 KB, lo que significa que un corpus de 100 millones de fragmentos requeriría aproximadamente 819 GB. Cambiar a un vector int8 de 1.024 dimensiones reduce esta huella a aproximadamente 102 GB. Para una eficiencia aún mayor, un vector binario de 256 dimensiones reduce el mismo conjunto de datos a unos 3,2 GB. Cohere recomienda el formato int8 de 1.024 dimensiones para la mayoría de los casos de uso, ya que equilibra el ahorro de memoria con una calidad de recuperación casi de precisión completa. Se sugieren representaciones binarias para las etapas iniciales de recuperación donde la velocidad es crítica, seguidas de un reranking de mayor precisión.
Los modelos también admiten entradas multimodales, incluyendo texto, imágenes y combinaciones fusionadas de texto e imagen, en más de 100 idiomas. Cuentan con una ventana de contexto de 128K tokens, lo que les permite procesar directamente documentos grandes o datos visuales complejos. Esta capacidad habilita la incrustación de imágenes de páginas o entradas combinadas en un solo vector, simplificando el manejo de diversos tipos de documentos en aplicaciones modernas de IA.
Detalles clave
- Embed 5 Pro cuesta $0,12 por millón de tokens, mientras que Embed 5 Fast cuesta $0,08 por millón de tokens.
- El modelo Fast ofrece un promedio de 2,4 veces el rendimiento de documentos en comparación con el modelo Pro en las pruebas de Cohere.
- La indexación Pro con consultas Fast obtuvo una puntuación de 98,4 relativa a una línea base de Pro a Pro de 100 en 40 conjuntos de datos.
- Ambos modelos admiten seis dimensiones vectoriales desde 256 hasta 2.048, con opciones de formato float32, int8 y binario.
- Los modelos manejan texto, imágenes y entradas fusionadas en más de 100 idiomas con una ventana de contexto de 128K tokens.
- Embed 5 está disponible a través de la API de Cohere, Model Vault, Microsoft Foundry, Amazon SageMaker, y admite despliegues en VPC privada y on-premises mediante vLLM.
Por qué importa
Para los ingenieros de software que construyen sistemas RAG, la capacidad de desacoplar la calidad de la indexación de la latencia de la consulta es una ventaja operativa significativa. La mayoría de los entornos de producción son intensivos en lectura, lo que significa que el costo y la velocidad de las consultas dominan el costo total de propiedad. Al utilizar un modelo más barato y rápido para la ruta de consulta de alto volumen, los equipos pueden reducir los costos de API y mejorar la experiencia del usuario sin la sobrecarga de gestionar múltiples índices o reprocesar datos.
Sin embargo, los resultados de referencia vienen con advertencias importantes. Cohere evaluó Embed 5 utilizando RCP-nDCG@10, una métrica que utiliza criterios de relevancia específicos de la consulta en lugar de etiquetas fijas. Si bien este método puede identificar resultados relevantes pasados por alto por las referencias tradicionales, mide el reranking sobre un conjunto de candidatos fijo en lugar de la recuperación de primera etapa desde el corpus completo. La recuperación de primera etapa fue evaluada por separado utilizando nDCG y Recall estándar, lo que significa que las puntuaciones reportadas no son directamente comparables entre todos los tipos de evaluación.
Los equipos de producción deben validar estos hallazgos contra sus propios datos. Los errores de recuperación en los flujos de trabajo de agentes pueden acumularse a través de múltiples pasos, llevando a problemas significativos aguas abajo. Por lo tanto, aunque la caída promedio de la puntuación es pequeña, dominios específicos o patrones de consulta pueden comportarse de manera diferente. Los ingenieros deberían evaluar la configuración de Pro a Fast contra su corpus específico y distribución de consultas antes de migrar completamente.
Qué puedes hacer
- Evalúa tu pipeline RAG actual utilizando Embed 5 Pro para la indexación y Fast para las consultas para medir el ahorro en latencia y costos.
- Evalúa el impacto de diferentes dimensiones vectoriales y formatos de cuantización en tus costos de almacenamiento y precisión de recuperación.
- Prueba las capacidades multimodales incrustando imágenes de página o entradas fusionadas de texto e imagen si tu aplicación maneja diversos tipos de documentos.
- Revisa tu infraestructura para asegurarte de que soporta la opción de despliegue elegida, como vLLM para setups on-premises o VPC privadas.
- Monitorea de cerca la calidad de la recuperación en producción, especialmente si tu flujo de trabajo de agente involucra múltiples pasos secuenciales de recuperación.
- Considera usar vectores binarios para las etapas iniciales de recuperación seguidas de un reranking si las restricciones de almacenamiento son ajustadas.