Cloudflare ra mắt Clef, mô hình quyết định đa phương thức cho các tác vụ AI có cấu trúc
Cloudflare đã ra mắt Clef, một mô hình 27 tỷ tham số được tối ưu hóa cho việc trích xuất tài liệu và định tuyến. Mô hình này xử lý văn bản và hình ảnh trong một lần chạy duy nhất thông qua Ollama.
Được dịch tự động từ bản gốc tiếng Anh.
Cloudflare đã giới thiệu Clef, một mô hình quyết định đa phương thức mới được thiết kế để xử lý các tác vụ có cấu trúc như trích xuất trường dữ liệu từ tài liệu và định tuyến yêu cầu. Được phát hành vào đầu tháng 10 năm 2026, mô hình 27 tỷ tham số này được tinh chỉnh từ Qwen3.8-27B và tích hợp trực tiếp vào các quy trình làm việc kỹ thuật AI hiện có thông qua các API tiêu chuẩn.
Điều gì đã xảy ra
Clef đánh dấu sự chuyển dịch hướng tới các mô hình ra quyết định chuyên biệt thay vì chatbot đa năng. Mô hình này có khả năng xử lý đồng thời văn bản, cấu trúc JSON và hình ảnh. Điều này cho phép nó phân tích ảnh chụp màn hình, hóa đơn, biểu mẫu và ảnh cùng với dữ liệu văn bản để đưa ra các quyết định xác định. Cloudflare tuyên bố rằng Clef hiện đang dẫn đầu Decision Index, bảng xếp hạng nội bộ của họ dành cho các mô hình ra quyết định, và vượt trội hơn so với phiên bản tiền nhiệm Jev trên hầu hết các bộ benchmark.
Phiên bản phát hành bao gồm khả năng tương thích đầy đủ với các API Jev và System One. Điều này có nghĩa là các nhà phát triển có thể triển khai Clef bằng cách sử dụng endpoint /v1/systemone của Ollama mà không cần viết lại logic tích hợp của họ. Một biến thể nhỏ hơn và nhanh hơn tên là clef-flash cũng có sẵn cho các trường hợp sử dụng mà độ trễ quan trọng hơn độ chính xác tối đa. Cả hai phiên bản đều được phát hành theo giấy phép Apache 2.0, cho phép áp dụng rộng rãi trong thương mại và mã nguồn mở.
Cách hoạt động
Khác với các mô hình ngôn ngữ tự hồi quy truyền thống tạo văn bản từng token một, Clef hoạt động trong một lần chạy forward pass phi tự hồi quy duy nhất. Nó chấm điểm mọi lựa chọn có thể cho từng câu hỏi một cách đồng thời. Kiến trúc này giảm đáng kể thời gian suy luận cho các tác vụ phân loại và trích xuất vì mô hình không cần tạo ra các giải thích dài dòng trước khi đi đến kết luận. Thay vào đó, nó xuất ra các xác suất có cấu trúc cho các lựa chọn được định nghĩa trước.
Mô hình hỗ trợ cửa sổ ngữ cảnh 64K, gấp đôi dung lượng cửa sổ 32K của Jev. Ngữ cảnh lớn hơn này cho phép Clef xử lý các tài liệu dài hơn hoặc các tập lệnh phức tạp hơn trong một lần. Khi hình ảnh được bao gồm trong yêu cầu, chúng được mã hóa và chấm điểm cùng với văn bản. Việc chấm điểm đồng thời này đảm bảo rằng các tín hiệu trực quan, chẳng hạn như bố cục của một biểu mẫu hoặc con dấu trên hóa đơn, ảnh hưởng đến quyết định cuối cùng cùng với nội dung văn bản.
Các nhà phát triển tương tác với Clef bằng cách gửi một state (dữ liệu cần đánh giá) và một danh sách questions. Các câu hỏi xác định loại quyết định cần thực hiện, chẳng hạn như lựa chọn nhiều đáp án, kiểm tra đúng/sai nhị phân hoặc đánh giá có điểm số. Mô hình trả về lựa chọn đã chọn cùng với các phân phối xác suất và một chỉ số độ tin cậy. Điểm độ tin cậy này cho biết mức độ tập trung của các xác suất, giúp các kỹ sư xác định khi nào nên tin tưởng vào đầu ra hoặc chuyển giao cho người xem xét là con người.
Chi tiết chính
- Kích thước mô hình: 27 tỷ tham số, được tinh chỉnh từ Qwen3.8-27B.
- Cửa sổ ngữ cảnh: 64K token, hỗ trợ tài liệu dài và các lệnh phức tạp.
- Loại đầu vào: Văn bản, JSON và hình ảnh được mã hóa base64 (PNG, JPEG, WebP).
- Triển khai: Tương thích với Ollama qua endpoint
/v1/systemone; có thể cài đặt bằngollama pull clef. - Giấy phép: Apache 2.0, cho phép sử dụng thương mại và sửa đổi miễn phí.
- Định dạng đầu ra: JSON có cấu trúc với các lựa chọn, xác suất và điểm độ tin cậy.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm xây dựng các agent AI, Clef cung cấp một lựa chọn thay thế đáng tin cậy hơn so với việc nhắc nhở các mô hình ngôn ngữ lớn cho các tác vụ phân loại đơn giản. Các LLM đa năng thường bị ảo giác hoặc cung cấp định dạng không nhất quán khi được yêu cầu trích xuất các trường cụ thể từ tài liệu. Thiết kế phi tự hồi quy và định dạng đầu ra có cấu trúc của Clef giảm thiểu những lỗi này bằng cách buộc mô hình phải chọn từ các tùy chọn được định nghĩa trước. Điều này giúp dễ dàng tích hợp các quyết định AI vào logic kinh doanh xác định, chẳng hạn như định tuyến vé hỗ trợ khách hàng hoặc phê duyệt báo cáo chi phí.
Khả năng xử lý hình ảnh và văn bản trong một lần chạy cũng đơn giản hóa các pipeline đa phương thức. Trước đây, các kỹ sư có thể cần các công cụ OCR riêng biệt và các mô hình ngôn ngữ, nối chúng với nhau bằng các cơ chế xử lý lỗi mong manh. Clef thống nhất quá trình này, cho phép một cuộc gọi API duy nhất diễn giải hóa đơn quét và trích xuất các giá trị chính như ngày tháng và tổng số tiền. Giấy phép mã nguồn mở hơn nữa còn hạ thấp rào cản gia nhập, cho phép các nhóm tự lưu trữ mô hình để tuân thủ quyền riêng tư dữ liệu mà không phải trả phí cấp phép.
Bạn có thể làm gì
- Cài đặt Clef cục bộ bằng Ollama bằng cách chạy
ollama pull cleftrong terminal của bạn. - Thay thế các prompt phân loại hiện có bằng định dạng câu hỏi có cấu trúc của Clef để cải thiện độ chính xác.
- Sử dụng trường
imagesđể gửi ảnh chụp màn hình hoặc tài liệu quét để phân tích đồng thời văn bản-hình ảnh. - Triển khai các ngưỡng độ tin cậy trong ứng dụng của bạn để gắn cờ các quyết định có độ chắc chắn thấp cho người xem xét.
- Thử nghiệm biến thể clef-flash nếu ứng dụng của bạn yêu cầu độ trễ thấp hơn cho các tác vụ khối lượng lớn.
- Xem lại tài liệu API System One để ánh xạ các tích hợp Jev hiện tại của bạn sang Clef.



