AI agent

AWS phát hành Strands Decider 2B để xác thực agent cục bộ

AWS ra mắt Strands Decider 2B, một mô hình quyết định có thể tải về giúp xác thực các hành động của AI agent cục bộ với độ trễ dưới 100ms.

Được dịch tự động từ bản gốc tiếng Anh.

Amazon Web Services đã giới thiệu Strands Decider 2B, một mô hình quyết định nhỏ gọn được thiết kế để chạy cục bộ và xác thực các hành động của AI agent trước khi thực thi. Được phát hành vào ngày 1 tháng 10 năm 2026, công cụ này cung cấp cho các nhà phát triển một cơ chế nhanh chóng và đáng tin cậy để kiểm tra đầu ra của agent mà không cần phụ thuộc vào các API bên ngoài hay tạo ra văn bản không hợp lệ.

Chuyện gì đã xảy ra

Việc ra mắt này đưa AWS cạnh tranh trực tiếp với các mô hình quyết định mới nổi như Jev của TypeSafe, vốn gần đây đã thúc đẩy làn sóng các công cụ tương tự từ những nhà cung cấp AI lớn. Trong khi OpenAI vừa giới thiệu trước API Decisions được lưu trữ sử dụng mô hình Luna, AWS lại chọn cách tiếp cận khác bằng việc phát hành một mô hình hoàn toàn có thể tải về. Gói này bao gồm không chỉ trọng số, mà còn cả dữ liệu huấn luyện và script, cho phép các kỹ sư xem xét và điều chỉnh công thức nền tảng.

Strands Decider 2B là một phần của hệ sinh thái Strands rộng lớn hơn, được ươm mầm tại Strands Labs, trung tâm thử nghiệm của AWS dành cho AI dạng agent. Nó tiếp nối sự ra mắt gần đây của Strands Harness, cung cấp hạ tầng để vận hành các agent có vòng đời dài hơn. Bằng cách cung cấp một giải pháp thay thế mở và cục bộ cho các dịch vụ lưu trữ, AWS nhằm mục đích trao cho các nhà phát triển nhiều quyền kiểm soát hơn đối với các bước xác thực quan trọng trong quy trình làm việc của agent.

Cách hoạt động

Các mô hình quyết định khác biệt so với các mô hình ngôn ngữ lớn tiêu chuẩn bằng cách hạn chế không gian đầu ra của chúng. Thay vì tạo ra văn bản tự do, chúng chọn từ các tùy chọn do nhà phát triển cung cấp hoặc trả về điểm số dạng số. Strands Decider sử dụng Qwen3.5-2B làm nền tảng, được gọi là “thân”. Nhóm phát triển đã loại bỏ head mô hình ngôn ngữ tiêu chuẩn chịu trách nhiệm tạo văn bản và thay thế nó bằng một pointer head chứa hơn một triệu tham số. Head này chấm điểm các tùy chọn câu trả lời được cung cấp.

Phần backbone sử dụng adapter low-rank adaptation (LoRA) hạng 16. Bằng cách giới hạn các đầu ra có thể chỉ ở những tùy chọn do nhà phát triển cung cấp, mô hình không thể bịa ra các lựa chọn không tồn tại. Kiến trúc này đảm bảo rằng mọi đầu ra đều hợp lệ trong ngữ cảnh đã định, mặc dù nó không đảm bảo tính chính xác trong mọi trường hợp. Sự đánh đổi này mang lại các quyết định nhanh hơn và điểm số độ tin cậy được hiệu chỉnh, mà các ứng dụng có thể sử dụng để xác định các bước tiếp theo.

Trong thực tế, điều này cho phép thực hiện các bước kiểm tra trước khi thực thi. Ví dụ: nếu một agent đề xuất gọi công cụ thời tiết mà không chỉ định thành phố, Decider sẽ đánh giá xem các đối số có dựa trên cuộc hội thoại hay không. Nếu thiếu thông tin, hệ thống có thể chuyển hướng agent quay lại hỏi người dùng để làm rõ thay vì thực thi một lệnh gọi công cụ bị lỗi. Quy trình này chạy thông qua hệ thống can thiệp của Strands, cho phép các nhà phát triển định nghĩa các chính sách để tiếp tục, từ chối hoặc yêu cầu xác nhận từ con người.

Chi tiết chính

  • Mô hình được xây dựng dựa trên Qwen3.5-2B với một pointer head tùy chỉnh thay thế lớp tạo văn bản.
  • Nó đạt thời gian quyết định dưới 100 mili giây trên GPU Nvidia RTX 3090.
  • Trên MacBook M3, thời gian phản hồi trung vị cho các tác vụ nhỏ khoảng 150 mili giây.
  • Strands Decider 2B xếp thứ hai trong số các mô hình công khai có khoảng 2 tỷ tham số trên JevBench.
  • Nó xếp thứ nhất trong số các mô hình công khai cung cấp đầy đủ quy trình huấn luyện và dữ liệu.
  • Bản phát hành bao gồm tất cả các lần lặp kiến trúc trước đó trong repository để đảm bảo tính minh bạch.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm xây dựng agent tự chủ, độ tin cậy thường là rào cản lớn nhất. Các mô hình tạo sinh có thể ảo giác đối số công cụ hoặc bỏ sót các ràng buộc quan trọng, dẫn đến những lỗi khó gỡ lỗi. Strands Decider 2B giải quyết vấn đề này bằng cách chèn một bước kiểm tra nhanh, xác định giữa suy luận của agent và hành động của nó. Sự tách biệt mối quan tâm này cho phép các mô hình tạo sinh xử lý hội thoại phức tạp và sự sáng tạo, trong khi mô hình quyết định xử lý định tuyến và xác thực.

Tính chất cục bộ của mô hình rất quan trọng đối với các ứng dụng nhạy cảm về độ trễ và quyền riêng tư dữ liệu. Việc chạy xác thực trên thiết bị loại bỏ thời gian chờ mạng liên quan đến các API lưu trữ. Hơn nữa, việc bao gồm dữ liệu huấn luyện và script hỗ trợ tinh chỉnh cho các lĩnh vực cụ thể. Các nhà phát triển không còn bị khóa trong logic độc quyền của nhà cung cấp; họ có thể điều chỉnh mô hình phù hợp với các ràng buộc vận hành độc đáo của mình và xác minh hành vi của nó thông qua các benchmark được cung cấp.

Bạn có thể làm gì

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Tất cả bài viết