AI mở & chạy cục bộ

Reflection AI ra mắt Beam, mô hình mở trọng số chi phí thấp cho suy luận

Reflection AI vừa công bố Beam, một mô hình mở trọng số được tuyên bố là có khả năng suy luận ngang tầm với các đối thủ Trung Quốc nhưng sử dụng ít tài nguyên tính toán suy luận hơn đáng kể.

Một khối kim loại với các mạch điện phát sáng lơ lửng phía trên các kệ máy chủ.
Minh họa được tạo riêng cho bài viết này

Được dịch tự động từ bản gốc tiếng Anh.

Reflection AI, một startup có trụ sở tại Brooklyn được thành lập vào năm 2024, đã chính thức ra mắt Beam, mô hình trí tuệ nhân tạo mở trọng số tiên phong đầu tiên của họ. Việc phát hành này đánh dấu sự gia nhập quan trọng vào thị trường cạnh tranh khốc liệt của các mô hình ngôn ngữ lớn, định vị Beam như một giải pháp thay thế tiết kiệm chi phí so với cả các hệ thống mã nguồn đóng và các lựa chọn mở trọng số hiện có từ Trung Quốc và phương Tây.

Diễn biến

Công ty mô tả Beam là một mô hình chỉ xử lý văn bản, sử dụng kiến trúc hỗn hợp chuyên gia (mixture-of-experts), được thiết kế đặc biệt cho các tác vụ suy luận nâng cao, lập trình và tác vụ agent. Theo Reflection, mô hình này mang lại hiệu suất tương đương với các mô hình mở hàng đầu của Trung Quốc trên các bài kiểm chuẩn phức tạp, nhưng hoạt động với chi phí token và thời gian tính toán suy luận chỉ bằng một phần nhỏ so với các đối thủ. Thông báo này xác nhận những tin tức trước đó cho thấy startup đang tiến gần đến ngày ra mắt công chúng.

Beam có tổng cộng 501 tỷ tham số, với 23 tỷ tham số hoạt động trong quá trình suy luận. Mô hình được tiền huấn luyện trên một tập dữ liệu khổng lồ gồm 23,8 nghìn tỷ token và hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token. Để so sánh, mô hình GLM-5.2 của Z.ai chứa khoảng 744 tỷ tham số tổng với 40 tỷ tham số hoạt động. Reflection tuyên bố rằng mặc dù các chỉ số hiệu suất của họ chưa được xác minh độc lập, nhưng các bài kiểm chuẩn nội bộ cho thấy Beam ghi điểm ngang ngửa với GLM-5.2 và vượt trội hơn các mô hình mở dẫn đầu hiện nay của phương Tây.

Startup này định vị Beam trực tiếp đối đầu với các ông lớn bao gồm Anthropic, OpenAI, Mistral, Meta và Cohere. Đối thủ cạnh tranh nội địa gần nhất của nó có thể là Inkling, mô hình mở được Thinking Machines Lab phát hành vào tháng Bảy. Dữ liệu của Reflection cho thấy Beam ghi điểm cao hơn Inkling trong bốn bài kiểm tra lập trình cụ thể, tuy nhiên cần lưu ý rằng Inkling là mô hình đa phương thức trong khi Beam chỉ xử lý văn bản. Công ty dự định phát hành trọng số của mô hình và toàn bộ chi tiết kỹ thuật vào cuối tháng này, với kế hoạch phân phối thông qua các nhà cung cấp dịch vụ đám mây quy mô lớn (hyperscalers), neoclouds và các thư viện mã nguồn mở.

Cơ chế hoạt động

Beam sử dụng kiến trúc hỗn hợp chuyên gia, một lựa chọn thiết kế cho phép mô hình chỉ kích hoạt một tập con các tham số tổng thể của nó cho bất kỳ đầu vào nào. Tính thưa (sparsity) này giúp mô hình duy trì số lượng tham số tổng lớn để lưu trữ kiến thức trong khi giữ số lượng tham số hoạt động ở mức thấp trong quá trình vận hành. Kết quả là giảm tải tính toán trong quá trình suy luận, điều mà Reflection tuyên bố dẫn đến việc sử dụng tài nguyên tính toán suy luận ít hơn 3-4 lần so với các đối thủ.

Mô hình được huấn luyện bằng các kỹ thuật học tăng cường đòi hỏi tài nguyên tính toán cao. Cách tiếp cận huấn luyện này tập trung vào việc tối ưu hóa khả năng suy luận của mô hình qua các vấn đề phức tạp thay vì chỉ đơn thuần dự đoán từ tiếp theo trong một chuỗi. Bằng cách ưu tiên các khả năng suy luận, mô hình nhắm mục tiêu xử lý các tác vụ agent và thử thách lập trình hiệu quả hơn so với những gì các phương pháp tiền huấn luyện truyền thống đơn thuần có thể cho phép.

Chi tiết chính

  • Beam là mô hình có 501 tỷ tham số với 23 tỷ tham số hoạt động cho mỗi bước suy luận.
  • Mô hình được tiền huấn luyện trên 23,8 nghìn tỷ token và hỗ trợ cửa sổ ngữ cảnh 1 triệu token.
  • Reflection tuyên bố Beam sử dụng ít hơn 3-4 lần tài nguyên tính toán suy luận so với các mô hình đối thủ trong khi vẫn đạt hiệu suất tương đương trên các bài kiểm chuẩn suy luận.
  • Startup này đã huy động được khoảng 4,7 tỷ USD, với các nhà đầu tư bao gồm Nvidia, Sequoia Capital và Lightspeed Venture Partners.
  • Reflection đã ký kết các thỏa thuận trị giá hơn 7 tỷ USD với SpaceX và Nebius để truy cập các chip Nvidia GB300 cho đến năm 2029.
  • Công ty đang thúc đẩy khái niệm "nhà máy AI", cho phép các doanh nghiệp và quốc gia có chủ quyền huấn luyện các hệ thống AI cục bộ tùy chỉnh dựa trên dữ liệu độc quyền.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm và lãnh đạo kỹ thuật, lời hứa về chi phí suy luận thấp hơn là yếu tố then chốt. Khi các ứng dụng AI chuyển từ giai đoạn thử nghiệm sang môi trường sản xuất, chi phí vận hành các mô hình lớn có thể trở nên quá đắt đỏ. Một mô hình cung cấp khả năng suy luận đẳng cấp tiên phong với chi phí tính toán thấp hơn đáng kể có thể làm cho các tính năng AI nâng cao trở nên khả thi cho nhiều loại sản phẩm và dịch vụ hơn. Lợi ích về hiệu quả này đặc biệt liên quan đến các nhóm xây dựng quy trình làm việc agent hoặc trợ lý lập trình phức tạp, nơi độ trễ và chi phí là những ràng buộc chính.

Hơn nữa, việc ra mắt này làm gia tăng cuộc cạnh tranh giữa các mô hình mở trọng số của phương Tây và Trung Quốc. Các nhà phát triển vốn phụ thuộc vào các mô hình từ phòng thí nghiệm Trung Quốc để có hiệu suất tiết kiệm chi phí giờ đây đã có một lựa chọn nội địa tuyên bố hiệu quả tương tự. Sự đa dạng hóa này giảm bớt sự phụ thuộc vào bất kỳ khu vực địa lý đơn lẻ nào cho cơ sở hạ tầng AI nền tảng. Nó cũng gây áp lực lên các nhà cung cấp phương Tây khác phải tối ưu hóa mô hình của họ cho hiệu quả, có khả năng thúc đẩy đổi mới sáng tạo trong các kiến trúc thưa và phương pháp huấn luyện học tăng cường trên toàn ngành.

Bạn có thể làm gì

  • Theo dõi việc phát hành chính thức trọng số của Beam và tài liệu kỹ thuật vào cuối tháng này để đánh giá tính tương thích với hạ tầng hiện tại của bạn.
  • Đánh giá mức giảm 3-4 lần tài nguyên tính toán suy luận được tuyên bố so với yêu cầu khối lượng công việc cụ thể của bạn, lưu ý rằng những con số này hiện tại là do công ty tự báo cáo.
  • So sánh khả năng chỉ xử lý văn bản của Beam với các lựa chọn thay thế đa phương thức như Inkling nếu ứng dụng của bạn yêu cầu xử lý hình ảnh hoặc âm thanh cùng với suy luận văn bản.
  • Tìm hiểu khái niệm "nhà máy AI" nếu tổ chức của bạn xử lý dữ liệu độc quyền nhạy cảm và yêu cầu các hệ thống AI cục bộ, tùy chỉnh thay vì dựa vào các API công khai.
  • Xem xét các tùy chọn tích hợp với hyperscalers và neoclouds để xác định chiến lược triển khai tiết kiệm chi phí nhất cho đội ngũ của bạn.
  • Chú ý đến các kết quả kiểm chuẩn độc lập khi chúng xuất hiện để xác minh các tuyên bố hiệu suất của Reflection so với các tiêu chuẩn đã được thiết lập.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết