Cohere Embed 5: truy vấn nhanh, chất lượng gần nguyên

Cohere Embed 5 cho phép lập chỉ mục bằng Pro và truy vấn bằng Fast. Trong thử nghiệm của hãng, cấu hình này đạt 98,4 điểm và Fast có thông lượng xử lý tài liệu trung bình cao gấp 2,4 lần.

Hệ thống máy chủ xử lý truy vấn dữ liệu cho mô hình Cohere
Embed 5 tách việc lập chỉ mục khỏi truy vấn.

Nội dung chính của Cohere Embed 5

Cohere Embed 5 cho phép doanh nghiệp lập chỉ mục dữ liệu bằng Embed 5 Pro. Sau đó, Embed 5 Fast có thể truy vấn cùng các vectơ mà không cần tạo thêm chỉ mục. Trong thử nghiệm của Cohere, cấu hình này đạt 98,4 điểm so với mốc 100 khi dùng Pro cho cả hai khâu. Fast có giá thấp hơn và thông lượng xử lý tài liệu trung bình cao gấp 2,4 lần.

Theo bài viết của The New Stack, Cohere khuyến nghị dùng Pro cho khâu lập chỉ mục và Fast cho truy vấn. Khuyến nghị này đặc biệt áp dụng cho các hệ thống tạo sinh tăng cường truy xuất và tác tử. Độ trễ có thể cộng dồn khi một tác tử tìm kiếm nhiều lần trên cùng tập dữ liệu. Đây cũng là một yếu tố trong cách doanh nghiệp thiết kế hạ tầng trí tuệ nhân tạo.

Chất lượng truy xuất giảm nhẹ trong thử nghiệm của Cohere. Trên 40 bộ dữ liệu gồm văn bản, hình ảnh, tài liệu kết hợp và tài liệu đã phân tích, truy vấn Fast trên chỉ mục Pro đạt 98,4 điểm. Khi Fast được dùng cho cả lập chỉ mục lẫn truy vấn, điểm số giảm còn 96,6. Cohere cho biết không bộ dữ liệu riêng lẻ nào giảm mạnh khi kết hợp Pro và Fast.

Pro và Fast dùng chung không gian nhúng như thế nào?

Embed 5 Pro và Embed 5 Fast tạo các vectơ tương thích trong cùng một không gian nhúng. Doanh nghiệp có thể chuyển phần truy vấn từ Pro sang Fast mà không phải nhúng lại toàn bộ kho dữ liệu. Khả năng này vẫn áp dụng khi sử dụng kỹ thuật rút gọn Matryoshka hoặc lượng tử hóa int8.

Cấu hìnhĐiểm thử nghiệm của CohereGiá mỗi một triệu token
Pro lập chỉ mục, Pro truy vấn1000,12 USD
Pro lập chỉ mục, Fast truy vấn98,4Fast: 0,08 USD
Fast lập chỉ mục, Fast truy vấn96,60,08 USD

Cohere niêm yết Pro ở mức 0,12 USD cho mỗi một triệu token và Fast ở mức 0,08 USD. Trong thử nghiệm của hãng, Fast đạt thông lượng xử lý tài liệu trung bình cao gấp 2,4 lần. Với hệ thống tạo sinh tăng cường truy xuất, tài liệu thường được tiếp nhận ít lần hơn số lần hệ thống tìm kiếm. Pro có thể xử lý dữ liệu lúc đưa vào chỉ mục, còn Fast đảm nhiệm lưu lượng truy vấn lớn hơn.

Sự phân tách này cũng áp dụng cho các hệ thống RAG và tác tử trí tuệ nhân tạo, nơi đường truy vấn và khâu chuẩn bị dữ liệu có thể có yêu cầu vận hành khác nhau.

Matryoshka giảm dung lượng vectơ ra sao?

Embed 5 Pro và Fast hỗ trợ sáu kích thước vectơ từ 256 đến 2.048, cùng các định dạng float32, int8 và nhị phân. Theo ước tính của Cohere, lựa chọn kích thước và định dạng có thể làm dung lượng của 100 triệu vectơ thay đổi từ 819 GB xuống 3,2 GB.

Định dạngSố chiềuDung lượng cho 100 triệu vectơ
float322.048Khoảng 819 GB
int81.024Khoảng 102 GB
Nhị phân256Khoảng 3,2 GB

Cohere ước tính một vectơ float32 có 2.048 chiều chiếm 8 KB. Đối với phần lớn phương án triển khai, hãng khuyến nghị vectơ int8 có 1.024 chiều. Cấu hình này giảm bộ nhớ và dung lượng lưu trữ trong khi giữ chất lượng truy xuất gần mức chính xác đầy đủ.

Biểu diễn nhị phân nén mạnh hơn nhưng làm giảm một phần độ chính xác. Định dạng này phù hợp hơn với bước truy xuất ban đầu trước khi kết quả được xếp hạng lại bằng độ chính xác cao hơn.

Embed 5 hỗ trợ những loại dữ liệu nào?

Embed 5 hỗ trợ văn bản, hình ảnh và đầu vào kết hợp bằng hơn 100 ngôn ngữ, theo thông báo kỹ thuật của Cohere. Đầu vào kết hợp có thể chứa cả văn bản và hình ảnh. Cửa sổ ngữ cảnh đạt 128K token. Mô hình có thể nhúng trực tiếp hình ảnh của trang hoặc kết hợp hình ảnh và văn bản trong một vectơ.

Trên năm bộ dữ liệu đánh giá đầu vào kết hợp văn bản với hình ảnh, Cohere báo cáo điểm trung bình của Pro là 82,3. Fast đạt 81,2, còn Gemini Embedding 2 của Google đạt 61,3.

Trong đánh giá tài liệu PDF đã phân tích, số liệu do Cohere công bố lần lượt là 84,8 cho Pro, 83,6 cho Voyage 4 Large, 83,4 cho Fast và 80,8 cho Gemini Embedding 2.

Với ViDoRe V3, Cohere dùng phần văn bản đã phân tích do nhóm xây dựng bộ đánh giá tuyển chọn. Hãng không dùng hình ảnh của trang trong phép thử này. Theo Cohere, Pro đạt trung bình 85,8 và Fast đạt 84,5. Voyage 4 Large đạt 83,7, Gemini Embedding 2 đạt 83,2, còn Embed 4 trước đó của Cohere đạt 77.

Kết quả đa ngôn ngữ của Cohere ít vượt trội hơn. Theo số liệu hãng công bố, Pro dẫn đầu mức trung bình trên năm ngôn ngữ châu Âu với 77 điểm, so với 76 của Voyage 4 Large và 73 của Gemini Embedding 2. Tuy nhiên, Pro đứng sau Gemini Embedding 2 trong chín phép thử.

Các điểm đánh giá của Cohere có ý nghĩa gì?

Embed 5 là dòng mô hình đầu tiên của Cohere được đánh giá bằng RCP-nDCG@10. Theo Cohere, phương pháp này dùng tiêu chí liên quan riêng cho từng truy vấn thay vì nhãn liên quan cố định, qua đó nhận diện những kết quả phù hợp mà nhãn gốc của bộ đánh giá có thể bỏ sót.

RCP-nDCG@10 đo việc xếp hạng lại trên một tập ứng viên cố định, không đo bước truy xuất ban đầu từ toàn bộ kho dữ liệu. Cohere đánh giá bước truy xuất ban đầu riêng bằng nDCG và Recall tiêu chuẩn.

Các phép thử với văn bản kết hợp hình ảnh, hình ảnh trang và nhiều mô hình sử dụng nDCG@10 tiêu chuẩn. Vì phương pháp đánh giá khác nhau, không thể đối chiếu trực tiếp mọi điểm số giữa các nhóm thử nghiệm.

Doanh nghiệp nên tách lập chỉ mục khỏi truy vấn không?

Embed 5 cho phép xem lập chỉ mục và phục vụ truy vấn như hai quyết định hạ tầng riêng. Một kho dữ liệu có thể được lập chỉ mục bằng Pro để ưu tiên chất lượng, trong khi Fast xử lý truy vấn để giảm chi phí và tăng thông lượng mà không cần duy trì hai dạng biểu diễn dữ liệu.

Mức 98,4 điểm do Cohere công bố cho thấy cấu hình lập chỉ mục bằng Pro và truy vấn bằng Fast giảm 1,6 điểm so với mốc 100 của cấu hình dùng Pro hoàn toàn. Tuy nhiên, đây là kết quả trung bình trên bộ thử nghiệm của chính Cohere, không phải bảo đảm cho mọi hệ thống.

Các hệ thống tạo sinh tăng cường truy xuất và tác tử vẫn cần so sánh hai cấu hình trên kho dữ liệu và phân bố truy vấn thực tế. Việc kiểm thử riêng đặc biệt cần thiết khi một lỗi truy xuất có thể ảnh hưởng đến nhiều bước xử lý tiếp theo.

Embed 5 Pro và Fast hiện có qua giao diện lập trình ứng dụng và Model Vault của Cohere. Hai mô hình cũng có trên Microsoft Foundry và Amazon SageMaker. Cohere hỗ trợ triển khai trong mạng đám mây riêng ảo và tại chỗ thông qua vLLM.

Nếu đang xây dựng hệ thống truy xuất cho tác tử, hãy thử Pro và Fast trên dữ liệu thực tế trước khi quyết định cấu hình phục vụ.