Bespoke Labs ra mắt Nimble, mô hình quyết định 9B tốc độ cao cho suy luận cục bộ
Bespoke Labs đã phát hành Nimble, một mô hình quyết định 9B với trọng số mở (open-weight), được tinh chỉnh từ Qwen3.5-9B, cung cấp các câu trả lời xác suất cho những câu hỏi có cấu trúc trong vòng chưa đầy 100ms trên phần cứng cục bộ.
Được dịch tự động từ bản gốc tiếng Anh.
Bespoke Labs đã phát hành Nimble, một mô hình quyết định mới với trọng số mở, được thiết kế cho suy luận cục bộ nhanh chóng. Được tinh chỉnh từ kiến trúc Qwen3.5-9B, mô hình 9 tỷ tham số này cho phép các nhà phát triển gửi văn bản cùng một tập hợp các câu hỏi có cấu trúc và nhận về các câu trả lời xác suất mà không cần qua bước suy luận truyền thống. Phiên bản phát hành bao gồm tài liệu API rõ ràng và các chỉ số hiệu suất, nhắm mục tiêu đến các kỹ sư cần khả năng xử lý biên (edge processing) hiệu quả.
Điều gì đã xảy ra
Nimble đánh dấu sự chuyển dịch hướng tới các mô hình quyết định chuyên biệt, ưu tiên tốc độ và đầu ra có cấu trúc hơn là sự sáng tạo trong sinh văn bản. Khác với các mô hình ngôn ngữ lớn (LLM) tiêu chuẩn vốn sinh văn bản theo từng token thông qua quá trình suy luận, Nimble được tối ưu hóa để chọn câu trả lời từ một tập hợp các lựa chọn được xác định trước. Mô hình đọc prompt đầu vào một lần cho mỗi câu hỏi và chấm điểm trực tiếp các token câu trả lời. Lựa chọn kiến trúc này loại bỏ độ trễ liên quan đến suy luận chuỗi tư duy (chain-of-thought reasoning), giúp mô hình trả kết quả trong vòng chưa đầy 100 mili giây trên MacBook Pro trang bị chip M5 Max.
Mô hình được phát hành dưới giấy phép Apache 2.0, phù hợp cho cả dự án thương mại lẫn mã nguồn mở. Bespoke Labs đã huấn luyện Nimble trên các cặp tương phản (contrastive pairs), một phương pháp xây dựng dữ liệu nơi hai ví dụ chỉ khác nhau bởi một chi tiết cụ thể làm đảo ngược câu trả lời đúng. Chiến lược huấn luyện này giúp mô hình tập trung vào các phân biệt chính xác về mặt thực tế thay vì các mẫu ngôn ngữ chung chung. Các nhà phát triển có thể tải trực tiếp mô hình bằng Ollama với lệnh ollama pull nimble, tích hợp nó vào các quy trình làm việc cục bộ hiện có với thiết lập tối thiểu.
Cách thức hoạt động
Nimble hoạt động thông qua endpoint /v1/systemone của Ollama, tuân thủ tiêu chuẩn Jev API của TypeSafe. Mô hình tương tác này khác biệt so với các giao diện trò chuyện thông thường. Người dùng cung cấp văn bản cần đánh giá trong một trường gọi là state, có thể là một chuỗi đơn giản hoặc một đối tượng JSON có cấu trúc. Cùng với state, người dùng gửi tối đa 64 câu hỏi có tên trong một yêu cầu duy nhất. Mô hình xử lý các câu hỏi này dựa trên văn bản được cung cấp và trả về câu trả lời theo đúng thứ tự chúng được đặt ra.
Hệ thống hỗ trợ ba loại câu hỏi chính: lựa chọn (choice), xác minh tính đúng/sai nhị phân (binary truth verification) và chấm điểm theo tiêu chí (rubric scoring). Đối với câu hỏi lựa chọn, người dùng định nghĩa một danh sách các tùy chọn, và mô hình sẽ trả về lựa chọn được chọn cùng với xác suất cho tất cả các tùy chọn. Câu hỏi nhị phân, được gọi là noul trong API, trả về phán quyết đúng hoặc sai kèm theo xác suất liên quan. Câu hỏi chấm điểm cho phép người dùng định nghĩa các mức độ sắp xếp với các tiêu chí cụ thể, trả về điểm số có trọng số xác suất. Trong mọi trường hợp, mô hình cung cấp một chỉ số độ tin cậy (confidence metric) từ 0 đến 1, cho biết mức độ tập trung của các xác suất, mặc dù đây không phải là thước đo trực tiếp cho tính chính xác.
Chi tiết chính
- Kích thước và nền tảng mô hình: Nimble là mô hình 9 tỷ tham số được tinh chỉnh từ Qwen3.5-9B.
- Hiệu suất: Nó cung cấp câu trả lời trong vòng chưa đầy 100ms trên MacBook Pro với chip M5 Max.
- Khả năng xử lý hàng loạt: Một cuộc gọi API duy nhất có thể xử lý tới 64 câu hỏi về cùng một văn bản.
- Dữ liệu huấn luyện: Mô hình được huấn luyện trên các cặp tương phản, nơi một thay đổi nhỏ về chi tiết làm đảo ngược câu trả lời.
- Giấy phép: Phát hành dưới giấy phép Apache 2.0, cho phép sử dụng thương mại và riêng tư rộng rãi.
- Định dạng đầu ra: Trả về dữ liệu có cấu trúc bao gồm các lựa chọn, điểm số, xác suất và chỉ số độ tin cậy.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm xây dựng hệ thống sản xuất, việc loại bỏ bước suy luận mang lại lợi ích đáng kể về độ trễ và chi phí. Các mô hình ngôn ngữ lớn truyền thống thường gặp khó khăn trong việc tạo ra đầu ra có cấu trúc nhất quán, đòi hỏi kỹ thuật prompt phức tạp hoặc xử lý hậu kỳ để trích xuất các quyết định đáng tin cậy. Thiết kế của Nimble đảm bảo rằng mọi phản hồi đều khớp với schema được định nghĩa trước, giảm bớt nhu cầu về các lớp xác thực và xử lý lỗi trong các ứng dụng hạ nguồn. Độ tin cậy này rất quan trọng đối với các nhiệm vụ như định tuyến vé hỗ trợ khách hàng, áp dụng chính sách tuân thủ hoặc đánh giá chất lượng nội dung, nơi hành vi xác định (deterministic behavior) được ưa chuộng hơn sự sáng tạo.
Khả năng chạy mô hình này cục bộ với tốc độ cao cũng giải quyết những lo ngại ngày càng tăng về quyền riêng tư dữ liệu và chi phí vận hành. Bằng cách xử lý văn bản nhạy cảm trên thiết bị mà không gửi nó đến các API bên ngoài, các tổ chức có thể duy trì kiểm soát chặt chẽ hơn đối với dữ liệu của họ. Hơn nữa, độ trễ thấp cho phép ra quyết định thời gian thực trong các ứng dụng hướng tới người dùng, chẳng hạn như xác thực biểu mẫu tức thì hoặc lọc nội dung động, mà không gây ra độ trễ đáng kể. Tính chất trọng số mở của mô hình cho phép các nhóm kiểm toán hành vi của nó và tinh chỉnh thêm cho các yêu cầu miền cụ thể.
Bạn có thể làm gì
- Cài đặt Ollama và tải mô hình Nimble bằng lệnh
ollama pull nimbleđể thử nghiệm tốc độ suy luận cục bộ. - Thử nghiệm với endpoint
/v1/systemonebằng cách gửi các state JSON có cấu trúc và định nghĩa tới 64 câu hỏi mỗi yêu cầu. - Triển khai một hệ thống định tuyến sử dụng loại câu hỏi 'lựa chọn' của Nimble để hướng dẫn các yêu cầu của người dùng đến các bộ phận phù hợp dựa trên điểm xác suất.
- Xây dựng một công cụ thực thi chính sách sử dụng loại câu hỏi 'chấm điểm' để đánh giá nội dung do người dùng tạo ra so với một bộ tiêu chí chấp nhận được đã định nghĩa.
- Sử dụng loại câu hỏi nhị phân
noulđể tạo ra các đường ống kiểm tra thực tế tự động, xác minh các điều kiện cụ thể trong tài liệu. - Giám sát chỉ số độ tin cậy được trả về bởi mô hình để gắn cờ các quyết định có độ chắc chắn thấp nhằm xem xét bởi con người, cải thiện độ tin cậy tổng thể của hệ thống.


