Cloudflare AI Search chính thức ra mắt với nhúng ảnh gốc và OCR
AI Search của Cloudflare hiện đã được phát hành rộng rãi (GA), bổ sung tính năng nhúng ảnh gốc, OCR cho PDF và hỗ trợ các tệp lớn hơn. Việc tính phí sẽ bắt đầu từ ngày 1 tháng 11 năm 2026.
Được dịch tự động từ bản gốc tiếng Anh.
Cloudflare đã chuyển sản phẩm AI Search từ giai đoạn thử nghiệm sang phát hành rộng rãi (General Availability), đánh dấu một bước tiến quan trọng đối với các nhà phát triển xây dựng quy trình tạo sinh tăng cường truy xuất (RAG). Bản cập nhật này giới thiệu các khả năng đa phương thức gốc, bao gồm nhúng ảnh trực tiếp và nhận dạng ký tự quang học (OCR) cho các tài liệu quét. Dịch vụ sẽ bắt đầu tính phí vào ngày 1 tháng 11 năm 2026, mặc dù vẫn có gói miễn phí dành cho các khối lượng công việc nhỏ.
Điều gì đã xảy ra
Việc ra mắt này mở rộng khả năng của nền tảng trong việc xử lý các loại dữ liệu phức tạp vượt ra ngoài văn bản đơn thuần. Trước đây, tìm kiếm hình ảnh dựa trên việc tạo chú thích văn bản từ nội dung trực quan và sau đó nhúng các chú thích đó. Cách tiếp cận này thường làm mất đi các chi tiết trực quan tinh tế như kết cấu, bảng màu hoặc mối quan hệ không gian trong biểu đồ và sơ đồ. Hệ thống mới bảo toàn cả sự hiểu biết về văn bản thông qua chú thích và tín hiệu trực quan trực tiếp thông qua nhúng ảnh gốc.
Bên cạnh hỗ trợ đa phương thức, Cloudflare đã tăng kích thước tệp tối đa cho việc nạp dữ liệu từ 4 MiB lên 10 MiB. Thay đổi này đáp ứng tốt hơn cho các bộ tài liệu lớn và các tài nguyên truyền thông phong phú hơn. Công ty cũng đã bật tính năng nhận dạng ký tự quang học (OCR) cho các tệp PDF chỉ chứa hình ảnh quét thay vì văn bản có thể chọn được. Khi được bật, hệ thống trích xuất văn bản từ từng trang trước khi chia nhỏ và nhúng, đảm bảo rằng các tài liệu quét cũ có thể được tìm kiếm.
Quá trình chuyển đổi sang phát hành rộng rãi cũng mang lại cấu trúc giá cả hoàn thiện. Trong Tuần lễ Agents vào tháng 8 năm 2026, Cloudflare đã công bố mức giá thử nghiệm, nhưng mô hình cuối cùng bao gồm một điều chỉnh nhỏ đối với gói miễn phí. Thay vì một pool truy vấn dùng chung, người dùng hiện nhận được hạn mức riêng biệt cho tìm kiếm ngữ nghĩa và tìm kiếm toàn văn. Bộ máy tính phí xác định chi phí dựa trên token nạp dữ liệu, dung lượng lưu trữ và loại truy vấn, loại bỏ nhu cầu lập kế hoạch dung lượng trước.
Cách hoạt động
Cải tiến cốt lõi trong việc xử lý hình ảnh dựa trên Matryoshka Representation Learning. Kỹ thuật này cho phép hệ thống tạo ra các vector nhúng (embeddings) giữ lại thông tin hữu ích ở nhiều mức độ chi tiết khác nhau. Bằng cách đó, nó giữ yêu cầu lưu trữ ở mức quản lý được trong khi vẫn duy trì tốc độ tìm kiếm. Mô hình Qwen3-VL-Embedding cung cấp sức mạnh cho truy xuất đa phương thức gốc, đưa pixel hình ảnh và văn bản vào cùng một không gian vector.
Khi người dùng gửi một truy vấn, hệ thống kiểm tra xem mô hình nhúng được chọn có hỗ trợ hình ảnh hay không. Nếu có, hình ảnh truy vấn sẽ được nhúng trực tiếp. Nếu mô hình chỉ hỗ trợ văn bản, hệ thống sẽ chuyển đổi hình ảnh thành văn bản bằng một công cụ gọi là ToMarkdown và thực hiện tìm kiếm bằng chú thích kết quả. Cách tiếp cận hai đường dẫn này đảm bảo tính tương thích giữa các cấu hình mô hình khác nhau đồng thời cung cấp độ chính xác cao hơn cho những người sử dụng mô hình đa phương thức.
Đối với các tài liệu quét, tính năng nhận dạng ký tự quang học hoạt động như một bước tiền xử lý. Nó đọc văn bản từ các tệp PDF dựa trên hình ảnh trước khi quy trình lập chỉ mục tiêu chuẩn bắt đầu. Quá trình này tiêu tốn token nạp dữ liệu xử lý hình ảnh, được tính phí riêng biệt so với nạp dữ liệu văn bản cơ bản. Phần còn lại của quy trình, bao gồm phân tích cú pháp, chia nhỏ và xếp hạng lại, vẫn nằm trong chi phí nạp dữ liệu cơ bản.
Chi tiết chính
- Nhúng ảnh gốc sử dụng mô hình Qwen3-VL-Embedding để bảo toàn các chi tiết trực quan như kết cấu và bố cục.
- Kích thước tệp tối đa cho việc nạp dữ liệu đã tăng từ 4 MiB lên 10 MiB đối với tệp văn bản và PDF.
- Nhận dạng ký tự quang học (OCR) có sẵn cho các PDF quét và được tính phí dưới dạng token nạp dữ liệu xử lý hình ảnh.
- Việc tính phí bắt đầu vào ngày 1 tháng 11 năm 2026, không yêu cầu giờ chạy instance hoặc mức tối thiểu hàng tháng.
- Gói miễn phí bao gồm 5 triệu token nạp dữ liệu, 10 GB dung lượng lưu trữ, 1.000 truy vấn ngữ nghĩa và 1.000 truy vấn toàn văn mỗi tháng.
- Chi phí nạp dữ liệu cơ bản là $0,75 cho mỗi 1 triệu token, cộng thêm $0,50 cho mỗi 1 triệu token đối với xử lý hình ảnh.
Tại sao điều này quan trọng
Đối với các nhóm kỹ sư xây dựng giao diện tìm kiếm, việc chuyển từ truy xuất hình ảnh dựa trên chú thích sang truy xuất hình ảnh gốc giảm bớt ma sát trong việc quản lý siêu dữ liệu. Các nhà phát triển không còn cần phải viết các mô tả tỉ mỉ để nắm bắt các sắc thái trực quan, điều đặc biệt có giá trị đối với danh mục thương mại điện tử, sơ đồ kỹ thuật hoặc thư viện ảnh chụp màn hình. Khả năng tìm kiếm theo sự tương đồng trực quan hoặc các truy vấn kết hợp văn bản và hình ảnh mở ra các trường hợp sử dụng mới mà trước đây khó triển khai nếu không có các quy trình thị giác máy tính tùy chỉnh.
Sự minh bạch của mô hình định giá giúp các nhóm dự báo chi phí chính xác hơn. Bằng cách chỉ tính phí cho việc nạp dữ liệu, lưu trữ và truy vấn, Cloudflare loại bỏ gánh nặng vận hành trong việc quản lý các instance máy chủ hoặc đơn vị mở rộng dung lượng. Cấu trúc trả theo mức sử dụng này hạ thấp rào cản gia nhập cho các startup và dự án phụ, trong khi gói miễn phí hào phóng cho phép thử nghiệm đáng kể trước khi cam kết sử dụng dịch vụ trả phí.
Hỗ trợ cho các tệp lớn hơn và tài liệu quét giải quyết các điểm đau phổ biến trong cơ sở tri thức doanh nghiệp. Nhiều tổ chức phụ thuộc vào các tệp PDF cũ về cơ bản là hình ảnh của văn bản. Việc bật OCR ngay từ đầu có nghĩa là các tài liệu này có thể được tích hợp vào các quy trình tìm kiếm AI hiện đại mà không cần các công cụ tiền xử lý bên ngoài. Điều này đơn giản hóa kiến trúc cần thiết để xây dựng các công cụ tìm kiếm nội bộ toàn diện.
Những gì bạn có thể làm
- Kiểm toán kho tài liệu hiện tại của bạn để xác định các tệp PDF quét sẽ hưởng lợi từ khả năng OCR mới.
- Thử nghiệm mô hình Qwen3-VL-Embedding với một tập con các tài nguyên hình ảnh của bạn để đánh giá độ chính xác của truy xuất trực quan gốc.
- Tính toán chi phí hàng tháng dự kiến của bạn bằng cách sử dụng các mức giá đã công bố cho việc nạp dữ liệu, lưu trữ và truy vấn để ngân sách cho việc bắt đầu tính phí vào tháng 11.
- Cập nhật các quy trình nạp dữ liệu của bạn để xử lý các tệp lên tới 10 MiB, tận dụng giới hạn kích thước tăng lên cho nội dung phong phú hơn.
- Xem xét các giới hạn của gói miễn phí để xác định xem khối lượng công việc phát triển và thử nghiệm hiện tại của bạn có phù hợp với hạn mức 5 triệu token và 10 GB dung lượng lưu trữ hay không.
- Khám phá các truy vấn tìm kiếm lai kết hợp mô tả văn bản với đầu vào hình ảnh để cải thiện mức độ liên quan cho các tập dữ liệu nặng về hình ảnh.


