Cohere Embed 5 tách biệt lập chỉ mục và truy vấn để giảm độ trễ RAG
Cohere ra mắt Embed 5, cho phép các nhà phát triển lập chỉ mục bằng mô hình Pro chất lượng cao và thực hiện truy vấn bằng mô hình Fast nhanh hơn trong cùng một không gian vector.
Được dịch tự động từ bản gốc tiếng Anh.
Cohere đã ra mắt Embed 5 vào thứ Tư, giới thiệu kiến trúc mô hình kép tách biệt việc lập chỉ mục dữ liệu khỏi quá trình thực thi truy vấn. Bản cập nhật này cho phép các nhóm kỹ thuật sử dụng Embed 5 Pro với độ trung thực cao hơn để xây dựng chỉ mục vector, đồng thời phục vụ các truy vấn trực tiếp bằng Embed 5 Fast có chi phí thấp hơn và thông lượng cao hơn, tất cả mà không cần duy trì các cấu trúc dữ liệu riêng biệt.
Điều gì đã xảy ra
Đổi mới cốt lõi trong bản phát hành này là không gian embedding được chia sẻ giữa hai mô hình. Trước đây, việc chuyển sang mô hình truy vấn hiệu quả hơn thường đòi hỏi phải lập chỉ mục lại toàn bộ kho ngữ liệu hoặc duy trì các chỉ mục song song, làm tăng gấp đôi chi phí lưu trữ và độ phức tạp vận hành. Với Embed 5, các nhà phát triển có thể nạp tài liệu bằng mô hình Pro để đảm bảo chất lượng truy xuất cao trong giai đoạn lập chỉ mục. Khi hệ thống phục vụ truy vấn của người dùng, nó sẽ chuyển sang mô hình Fast, hoạt động trong cùng kích thước vector và tiêu chuẩn tương thích.
Các thử nghiệm nội bộ của Cohere cho thấy phương pháp lai này dẫn đến sự suy giảm tối thiểu về chất lượng truy xuất. Trên 40 bộ dữ liệu bao gồm văn bản, hình ảnh, tài liệu kết hợp và tài liệu đã phân tích, sự kết hợp giữa lập chỉ mục Pro và truy vấn Fast đạt điểm tương đối 98,4 so với mức cơ sở 100 khi sử dụng Pro-to-Pro. Việc sử dụng mô hình Fast cho cả lập chỉ mục và truy vấn làm giảm điểm số xuống còn 96,6. Công ty lưu ý rằng không có bộ dữ liệu riêng lẻ nào cho thấy sự sụt giảm hiệu suất đáng kể khi sử dụng cấu hình hỗn hợp Pro-Fast.
Sự thay đổi kiến trúc này giải quyết một nút thắt phổ biến trong các quy trình Retrieval-Augmented Generation (RAG) và workflow tác nhân (agent). Trong các hệ thống này, việc nạp dữ liệu diễn ra không thường xuyên, nhưng các truy vấn tìm kiếm xảy ra lặp đi lặp lại và phải có độ trễ thấp. Bằng cách tối ưu hóa lưu lượng truy vấn nặng nề với mô hình Fast, các nhóm có thể giảm đáng kể thời gian phản hồi và chi phí hạ tầng mà không hy sinh độ chính xác được thiết lập trong giai đoạn lập chỉ mục ban đầu.
Cách thức hoạt động
Cả Embed 5 Pro và Fast đều tạo ra các vector tương thích ở cùng kích thước, cho phép chúng cùng tồn tại trong cùng một chỉ mục. Tính tương thích này mở rộng sang các kỹ thuật nén nâng cao như cắt tỉa Matryoshka và lượng tử hóa int8. Các nhà phát triển có thể chọn từ sáu kích thước vector dao động từ 256 đến 2.048, và lựa chọn giữa các định dạng float32, int8 hoặc binary tùy thuộc vào yêu cầu về lưu trữ và độ chính xác.
Tác động đến lưu trữ là rất lớn đối với các triển khai quy mô lớn. Một vector float32 tiêu chuẩn với 2.048 chiều chiếm 8 KB, nghĩa là một kho ngữ liệu gồm 100 triệu đoạn văn bản sẽ yêu cầu khoảng 819 GB. Chuyển sang vector int8 với 1.024 chiều giảm dung lượng này xuống còn khoảng 102 GB. Để đạt hiệu quả cao hơn nữa, một vector binary với 256 chiều thu nhỏ cùng tập dữ liệu đó xuống còn khoảng 3,2 GB. Cohere khuyến nghị định dạng int8 với 1.024 chiều cho hầu hết các trường hợp sử dụng, vì nó cân bằng giữa tiết kiệm bộ nhớ và chất lượng truy xuất gần với độ chính xác đầy đủ. Các biểu diễn nhị phân được đề xuất cho các giai đoạn truy xuất ban đầu khi tốc độ là yếu tố then chốt, sau đó là bước xếp hạng lại (reranking) với độ chính xác cao hơn.
Các mô hình cũng hỗ trợ đầu vào đa phương thức, bao gồm văn bản, hình ảnh và các kết hợp văn bản-hình ảnh, trên hơn 100 ngôn ngữ. Chúng có cửa sổ ngữ cảnh 128K token, cho phép xử lý trực tiếp các tài liệu lớn hoặc dữ liệu hình ảnh phức tạp. Khả năng này cho phép nhúng hình ảnh trang hoặc các đầu vào kết hợp vào một vector duy nhất, giúp đơn giản hóa việc xử lý các loại tài liệu đa dạng trong các ứng dụng AI hiện đại.
Chi tiết chính
- Embed 5 Pro có giá $0,12 mỗi triệu token, trong khi Embed 5 Fast có giá $0,08 mỗi triệu token.
- Mô hình Fast cung cấp thông lượng tài liệu trung bình gấp 2,4 lần so với mô hình Pro trong các bài kiểm tra của Cohere.
- Lập chỉ mục Pro với truy vấn Fast đạt điểm 98,4 so với mức cơ sở Pro-to-Pro là 100 trên 40 bộ dữ liệu.
- Cả hai mô hình đều hỗ trợ sáu kích thước vector từ 256 đến 2.048, với các tùy chọn định dạng float32, int8 và binary.
- Các mô hình xử lý văn bản, hình ảnh và đầu vào kết hợp trên hơn 100 ngôn ngữ với cửa sổ ngữ cảnh 128K token.
- Embed 5 có sẵn qua API của Cohere, Model Vault, Microsoft Foundry, Amazon SageMaker và hỗ trợ triển khai VPC riêng tư và on-premises thông qua vLLM.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm xây dựng hệ thống RAG, khả năng tách biệt chất lượng lập chỉ mục khỏi độ trễ truy vấn là một lợi thế vận hành đáng kể. Hầu hết các môi trường sản xuất đều thiên về đọc (read-heavy), nghĩa là chi phí và tốc độ của các truy vấn chiếm ưu thế trong tổng chi phí sở hữu. Bằng cách sử dụng một mô hình rẻ hơn và nhanh hơn cho đường dẫn truy vấn khối lượng lớn, các nhóm có thể giảm chi phí API và cải thiện trải nghiệm người dùng mà không gặp phải gánh nặng quản lý nhiều chỉ mục hoặc xử lý lại dữ liệu.
Tuy nhiên, các kết quả benchmark đi kèm với những lưu ý quan trọng. Cohere đánh giá Embed 5 bằng RCP-nDCG@10, một chỉ số sử dụng các tiêu chí liên quan cụ thể theo từng truy vấn thay vì nhãn cố định. Mặc dù phương pháp này có thể xác định các kết quả liên quan bị bỏ sót bởi các benchmark truyền thống, nó đo lường việc xếp hạng lại trên một tập hợp ứng viên cố định thay vì truy xuất giai đoạn đầu từ toàn bộ kho ngữ liệu. Truy xuất giai đoạn đầu được đánh giá riêng biệt bằng nDCG và Recall tiêu chuẩn, nghĩa là các điểm số được báo cáo không trực tiếp so sánh được giữa tất cả các loại đánh giá.
Các nhóm sản xuất phải xác minh những phát hiện này dựa trên dữ liệu của chính họ. Lỗi truy xuất trong các workflow tác nhân có thể tích lũy qua nhiều bước, dẫn đến các vấn đề nghiêm trọng ở phía sau. Do đó, mặc dù mức giảm điểm trung bình là nhỏ, các lĩnh vực cụ thể hoặc mẫu truy vấn có thể hoạt động khác nhau. Các kỹ sư nên benchmark cấu hình Pro-to-Fast dựa trên kho ngữ liệu và phân phối truy vấn cụ thể của họ trước khi di chuyển hoàn toàn.
Bạn có thể làm gì
- Benchmark pipeline RAG hiện tại của bạn bằng cách sử dụng Embed 5 Pro cho lập chỉ mục và Fast cho truy vấn để đo lường độ trễ và tiết kiệm chi phí.
- Đánh giá tác động của các kích thước vector và định dạng lượng tử hóa khác nhau lên chi phí lưu trữ và độ chính xác truy xuất của bạn.
- Kiểm tra các khả năng đa phương thức bằng cách nhúng hình ảnh trang hoặc đầu vào văn bản-hình ảnh kết hợp nếu ứng dụng của bạn xử lý các loại tài liệu đa dạng.
- Xem xét hạ tầng của bạn để đảm bảo nó hỗ trợ tùy chọn triển khai đã chọn, chẳng hạn như vLLM cho các thiết lập on-premises hoặc VPC riêng tư.
- Giám sát chặt chẽ chất lượng truy xuất trong môi trường sản xuất, đặc biệt nếu workflow tác nhân của bạn liên quan đến nhiều bước truy xuất tuần tự.
- Cân nhắc sử dụng vector nhị phân cho các giai đoạn truy xuất ban đầu, sau đó là xếp hạng lại nếu ràng buộc về lưu trữ là khắt khe.