Xây dựng với AI

EmbeddingGemma 2 mang tìm kiếm đa phương thức đến phần cứng tiêu dùng

Google phát hành EmbeddingGemma 2, một mô hình mã nguồn mở nhẹ giúp thống nhất các embedding cho văn bản, code, âm thanh và video để truy xuất hiệu quả trên thiết bị.

A glass cube with multimodal data layers on a desk beside a smartphone
Minh họa được tạo riêng cho bài viết này

Được dịch tự động từ bản gốc tiếng Anh.

Google đã phát hành EmbeddingGemma 2, một mô hình embedding đa phương thức với trọng số mở (open-weight), được thiết kế cho suy luận hiệu quả ngay trên thiết bị. Ra mắt vào ngày 6 tháng 10 năm 2026, bản cập nhật này mở rộng kiến trúc chỉ hỗ trợ văn bản ban đầu để tương thích gốc với code, hình ảnh, video và âm thanh trong cùng một không gian embedding chung. Mô hình nhằm mục đích kích hoạt các quy trình tạo sinh tăng cường bằng truy xuất (RAG) ưu tiên quyền riêng tư trực tiếp trên phần cứng tiêu dùng mà không cần dựa vào API đám mây.

Chuyện gì đã xảy ra

Mô hình EmbeddingGemma ban đầu đã đạt hơn 20 triệu lượt tải xuống từ các nhà phát triển xây dựng công cụ tìm kiếm cục bộ và hệ thống RAG riêng tư. Đáp ứng nhu cầu này, các nhà nghiên cứu Sahil Dua và Henrique Schechter Vera của Google DeepMind đã giới thiệu EmbeddingGemma 2 để xử lý dữ liệu đa phương thức phức tạp. Được xây dựng trên kiến trúc Gemma 4, mô hình mới chứa 740 triệu tham số và được phát hành theo giấy phép Apache 2.0 cho phép sử dụng thương mại linh hoạt. Điều này cho phép các kỹ sư tích hợp tìm kiếm ngữ nghĩa chất lượng cao vào ứng dụng trong khi vẫn giữ toàn bộ quá trình xử lý dữ liệu ngoại tuyến.

EmbeddingGemma 2 đạt điểm hiệu suất hàng đầu trong số các mô hình nhúng đa phương thức có dưới 1 tỷ tham số. Nó ngang bằng hoặc vượt trội so với các mô hình chuyên biệt lớn hơn trên các benchmark về văn bản, thị giác và âm thanh, bao gồm Massive Text Embedding Benchmark (MTEB) Code và Massive Audio Embedding Benchmark (MAEB). Bằng cách thống nhất các phương thức này, mô hình cho phép thực hiện các tác vụ như tìm kiếm đoạn video cụ thể bằng ghi chú giọng nói hoặc tìm kiếm hàng giờ bản ghi âm bằng truy vấn văn bản. Khả năng này được xử lý bởi một mô hình duy nhất thay vì yêu cầu các bộ mã hóa riêng biệt cho từng loại phương tiện.

Cách thức hoạt động

Mô hình sử dụng thiết kế module cho phép các nhà phát triển chỉ tải những thành phần họ cần. Một khối lượng công việc chỉ dùng văn bản yêu cầu chỉ 270 triệu tham số, trong khi các bộ mã hóa thị giác và âm thanh tùy chọn bổ sung lần lượt 170 triệu và 300 triệu tham số. Tính module này đảm bảo rằng các ứng dụng có thể duy trì sự nhẹ nhàng nếu chúng không cần hỗ trợ đa phương thức đầy đủ. Về hiệu quả lưu trữ, mô hình áp dụng Matryoshka Representation Learning (MRL). Kỹ thuật này cho phép các nhà phát triển cắt ngắn động các vector đầu ra từ 768 chiều xuống còn 512, 256 hoặc 128 chiều. Việc cắt ngắn vector theo cách này có thể giảm yêu cầu lưu trữ cho cơ sở dữ liệu vector cục bộ lên tới sáu lần.

Tối ưu hóa hiệu suất là trọng tâm của kiến trúc. Với lượng tử hóa (quantization), mô hình đa phương thức đầy đủ yêu cầu khoảng 567MB RAM đang hoạt động trên Google Pixel 11 Pro, trong khi phiên bản chỉ văn bản chỉ cần khoảng 191MB. Mô hình cũng có cửa sổ ngữ cảnh 8K token, gấp bốn lần so với người tiền nhiệm. Ngữ cảnh mở rộng này cho phép hệ thống xử lý tối đa 5,5 phút âm thanh, 29 hình ảnh hoặc 58 khung hình video trong một lần chạy. Vì nó chia sẻ tokenizer văn bản và bộ mã hóa âm thanh với Gemma 4, các nhà phát triển có thể chạy cả hai mô hình cùng nhau trong một quy trình thống nhất với mức tiêu thụ bộ nhớ kết hợp thấp hơn.

Chi tiết chính

  • Số lượng tham số: Tổng cộng 740 triệu, với các thành phần module cho văn bản (270M), thị giác (170M) và âm thanh (300M).
  • Giấy phép: Apache 2.0, cho phép sử dụng và chỉnh sửa thương mại.
  • Cửa sổ ngữ cảnh: 8K token, hỗ trợ tối đa 5,5 phút âm thanh hoặc 58 khung hình video.
  • Hiệu quả lưu trữ: Matryoshka Representation Learning cho phép cắt ngắn vector từ 768 xuống 128 chiều, tiết kiệm tới 6 lần dung lượng lưu trữ.
  • Hiệu suất: Cải thiện điểm nhúng code thêm 9,92 điểm trên MTEB Code so với phiên bản trước.
  • Yêu cầu phần cứng: Chạy trên thiết bị tiêu dùng, yêu cầu ~567MB RAM cho mô hình đa phương thức đầy đủ trên Pixel 11 Pro.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm xây dựng hệ thống tìm kiếm và truy xuất, bản phát hành này loại bỏ nhu cầu gửi dữ liệu nhạy cảm đến các dịch vụ đám mây bên ngoài. Xử lý embedding cục bộ đảm bảo quyền riêng tư dữ liệu và giảm độ trễ, yếu tố then chốt cho các ứng dụng thời gian thực. Khả năng chạy tìm kiếm đa phương thức phức tạp trên phần cứng biên (edge hardware) có nghĩa là các ứng dụng di động và công cụ máy tính để bàn có thể cung cấp hiểu biết ngữ nghĩa tinh vi mà không cần kết nối internet liên tục. Điều này đặc biệt có giá trị đối với các ngành có yêu cầu tuân thủ nghiêm ngặt hoặc cho người dùng ở môi trường băng thông thấp.

Sự cải thiện trong hiệu suất nhúng code cũng làm cho mô hình này rất phù hợp cho việc lập chỉ mục mã nguồn cục bộ và tìm kiếm code ngữ nghĩa. Các nhà phát triển có thể xây dựng các agent lập trình truy xuất các đoạn mã hoặc tài liệu liên quan trực tiếp từ kho lưu trữ cục bộ của họ. Bằng cách sánh ngang chất lượng của các mô hình lớn hơn nhiều trong khi vẫn duy trì kích thước nhỏ gọn, EmbeddingGemma 2 hạ thấp rào cản gia nhập cho việc xây dựng các tính năng AI nâng cao. Nó cho phép các nhóm thử nghiệm nguyên mẫu và triển khai các quy trình RAG mạnh mẽ mà không cần quản lý cơ sở hạ tầng GPU đắt đỏ.

Bạn có thể làm gì

  • Tải trọng số mô hình từ Hugging Face hoặc Kaggle để bắt đầu thử nghiệm suy luận cục bộ.
  • Sử dụng LiteRT hoặc MediaPipe để triển khai các ứng dụng đa nền tảng với các tác vụ nhúng và truy xuất hoàn chỉnh.
  • Triển khai lưu trữ vector bằng Qdrant hoặc các cơ sở dữ liệu tương thích khác để tận dụng các chiều vector đã được cắt ngắn.
  • Tinh chỉnh (fine-tune) mô hình cho các trường hợp sử dụng cụ thể bằng hướng dẫn do Unsloth cung cấp.
  • Xây dựng các ứng dụng dựa trên trình duyệt bằng transformers.js hoặc WebGPU cho tìm kiếm ngữ nghĩa phía client.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Xây dựng với AI

Benchmark của Red Hat cho thấy các bộ phân loại nhỏ có thể sánh ngang LLM lớn trong việc phát hiện tấn công prompt injection

Theo các benchmark mới từ Red Hat, một mô hình chỉ với 200 triệu tham số đã đạt độ chính xác tương đương với một LLM 35 tỷ tham số khi làm nhiệm vụ đánh giá (judge) về prompt injection, đồng thời chạy nhanh hơn đáng kể.

Tất cả bài viết