Xây dựng với AI

OpenAI ra mắt Decisions API để giảm chi phí giám sát tác nhân

OpenAI đã giới thiệu Decisions API mới tại sự kiện Dev Day, cung cấp khả năng phân loại nhanh chóng và chi phí thấp, tương tự như mô hình Jev của TypeSafe AI nhằm bảo vệ các tác nhân AI.

Được dịch tự động từ bản gốc tiếng Anh.

Tại sự kiện Dev Day vào thứ Ba, CEO OpenAI Sam Altman đã công bố Decisions API, một công cụ mới được thiết kế để tối ưu hóa quá trình ra quyết định cho các phần mềm tác nhân (software agents). Thông báo này nối tiếp việc phát hành gần đây của Jev bởi TypeSafe AI, đánh dấu sự chuyển dịch hướng tới các mô hình chuyên biệt, tốc độ cao dành cho các nhiệm vụ tự động hóa.

Chuyện gì đã xảy ra

Decisions API cho phép các nhà phát triển cung cấp cho mô hình Luna một tập hợp các lựa chọn được xác định trước, chẳng hạn như danh mục hình ảnh hoặc hành vi cụ thể của tác nhân. Sau đó, mô hình sẽ chọn từ những tùy chọn này với tốc độ cao hơn và chi phí tính toán thấp hơn so với suy luận truyền thống của các mô hình ngôn ngữ lớn (LLM). Ông Altman tuyên bố rằng phương pháp này vẫn duy trì các khả năng như hiểu hình ảnh và các biện pháp bảo vệ an toàn, đồng thời tập trung mô hình vào các quyết định cụ thể.

TypeSafe AI, startup đứng sau Jev, đã không phản hồi các yêu cầu bình luận về sản phẩm mới. Tuy nhiên, Diogo Almeida, CEO của TypeSafe và là cựu kỹ sư của OpenAI, đã bình luận trên mạng xã hội về sự xuất hiện của các công nghệ tương tự. Ông gợi ý rằng động thái của OpenAI xác nhận khái niệm về kiến trúc tương thích "System One" (Tư duy Hệ thống 1), ưu tiên xử lý nhanh, trực giác thay vì suy luận chậm rãi, có chủ đích.

Thị trường đang chứng kiến hoạt động gia tăng trong ngách này, với nhiều startup khác cũng tung ra các mô hình hoạt động như những bộ phân loại siêu mạnh. Mặc dù những điểm tương đồng kỹ thuật chính xác giữa Decisions API và Jev vẫn chưa rõ ràng do trạng thái xem trước hạn chế của công cụ từ OpenAI, nhưng sự quan tâm của ngành là rất rõ rệt. Giá trị cốt lõi của cả hai công cụ nằm ở việc giải quyết vấn đề độ trễ và chi phí liên quan đến việc sử dụng LLM đa năng cho các tác vụ tự động hóa phần mềm thường xuyên.

Cách thức hoạt động

Các mô hình ra quyết định này hoạt động như những bộ phân loại chuyên biệt được xây dựng dựa trên nền tảng của các mô hình ngôn ngữ lớn. Thay vì tạo ra văn bản mở, chúng đánh giá đầu vào đã cho dựa trên một danh sách hạn chế các đầu ra có thể. Hệ thống gán xác suất cho mỗi tùy chọn, cho phép ứng dụng chọn hành động hoặc danh mục có khả năng đúng nhất.

Cơ chế này khác biệt so với AI tạo sinh tiêu chuẩn bằng cách giới hạn không gian đầu ra. Bằng cách hạn chế mô hình chỉ chọn từ một tập hợp cố định các phương án, tải trọng tính toán giảm đáng kể. Điều này dẫn đến thời gian phản hồi nhanh hơn và chi phí thấp hơn cho mỗi truy vấn, giúp việc chạy các kiểm tra này cho từng hành động mà một tác nhân tự động thực hiện trở nên khả thi.

TypeSafe nhấn mạnh rằng trí thông minh của các mô hình này đến từ chất lượng dữ liệu tổng hợp được sử dụng trong quá trình huấn luyện. Ông Almeida lưu ý rằng mặc dù đạt được tốc độ và chi phí thấp là điều dễ dàng, nhưng việc duy trì độ chính xác cao và tính hữu ích về mặt thống kê mới là thách thức chính. Mục tiêu là tối ưu hóa tỷ lệ giữa trí thông minh và chi phí, đảm bảo rằng các quyết định nhanh chóng vẫn đáng tin cậy và được hiệu chỉnh phù hợp với các kịch bản thực tế.

Chi tiết chính

  • OpenAI đã ra mắt Decisions API dưới dạng bản xem trước hạn chế trong sự kiện Dev Day vào thứ Ba.
  • API này cho phép mô hình Luna chọn từ các tùy chọn được xác định trước, chẳng hạn như danh mục hình ảnh hoặc hành vi của tác nhân.
  • TypeSafe AI đã phát hành Jev vào đầu tháng này, một mô hình được thiết kế cho mục đích tự động hóa phần mềm tốc độ cao, chi phí thấp tương tự.
  • Shapor Naghibzadeh đã chứng minh rằng việc giám sát hành động của tác nhân bằng Jev tốn 2,94 USD, so với 372 USD khi sử dụng một LLM hàng đầu (frontier LLM).
  • Diogo Almeida mô tả xu hướng này là bước chuyển mình sang tư duy "System One", ưu tiên xử lý nhanh và trực giác.
  • Công nghệ này đang được khám phá như một biện pháp bảo mật để giám sát và chặn các tác nhân AI hành xử sai trái theo thời gian thực.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng tác nhân tự động, chi phí và độ trễ là những nút thắt cổ chai then chốt. Các LLM truyền thống thường quá chậm và đắt đỏ để đóng vai trò là hệ thống giám sát thời gian thực cho từng bước mà tác nhân thực hiện. Việc giới thiệu các API ra quyết định chuyên dụng mang đến một con đường khả thi để triển khai giám sát liên tục mà không phải chịu chi phí prohibitive (quá cao). Sự chuyển dịch này có thể làm cho việc bảo vệ các tác nhân khỏi những hành vi ngoài ý muốn trở nên khả thi về mặt kinh tế, chẳng hạn như các sự cố đã được quan sát trước đây trên các nền tảng như Hugging Face.

Cuộc cạnh tranh giữa các phòng thí nghiệm lâu năm và các startup chuyên biệt làm nổi bật một xu hướng rộng lớn hơn trong cơ sở hạ tầng AI. Khi các tác nhân trở nên phức tạp hơn, nhu cầu về các thành phần nhẹ, chuyên biệt ngày càng tăng. Các nhà phát triển không còn có thể chỉ dựa vào các mô hình nguyên khối (monolithic models) cho mọi nhiệm vụ. Thay vào đó, họ có khả năng sẽ áp dụng các kiến trúc lai, nơi suy luận nặng nề được dành riêng cho các vấn đề phức tạp, trong khi các bộ phân loại nhanh chóng xử lý các quyết định thường nhật và kiểm tra an toàn.

Sự tiến hóa này cũng đặt ra câu hỏi về hiệu chuẩn (calibration) và độ tin cậy. Khi ngày càng nhiều nhà cung cấp tham gia thị trường với các sản phẩm tương tự, yếu tố khác biệt sẽ nằm ở mức độ các mô hình này phù hợp với kết quả thực tế. Các kỹ sư phải đánh giá không chỉ tốc độ và giá cả, mà cả độ vững chắc thống kê của các quyết định do hệ thống đưa ra. Khả năng tin tưởng vào các bộ phân loại nhanh này sẽ quyết định mức độ áp dụng chúng trong các quy trình bảo mật và tự động hóa quan trọng.

Bạn có thể làm gì

  • Đánh giá xem kiến trúc tác nhân hiện tại của bạn có yêu cầu giám sát thời gian thực cho mọi hành động hay không.
  • Thử nghiệm Decisions API của OpenAI trong bản xem trước hạn chế để so sánh hiệu suất với các bộ phân loại hiện có của bạn.
  • Thử nghiệm với Jev của TypeSafe hoặc các sản phẩm tương tự từ startup để đo lường cải thiện về chi phí và độ trễ.
  • Xác định các tập hợp tùy chọn rõ ràng, hạn chế cho các tác nhân của bạn để giảm sự mơ hồ và cải thiện tốc độ ra quyết định.
  • Giám sát việc hiệu chuẩn của các mô hình nhanh này bằng cách so sánh đầu ra của chúng với dữ liệu chuẩn (ground truth data) trong lĩnh vực của bạn.
  • Cân nhắc triển khai phương pháp tiếp cận lai, nơi các mô hình ra quyết định nhanh xử lý các kiểm tra thường nhật và các LLM lớn hơn xử lý các ngoại lệ phức tạp.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Xây dựng với AI

NVIDIA VSS 3.3 giảm chi phí AI thị giác nhờ lấy mẫu thích ứng và xây dựng dựa trên prompt

NVIDIA phát hành Blueprint VSS 3.3, giới thiệu tính năng Lấy mẫu Video Hiệu quả Thích ứng (Adaptive Efficient Video Sampling) để giảm mức sử dụng token và kỹ năng Build Vision Agent cho phép tạo ra các triển khai đa luồng công việc từ một prompt duy nhất.

Tất cả bài viết