Xây dựng với AI

Ember-1 đạt độ chính xác của Kimi K3 với độ trễ thấp hơn đáng kể

Các bài kiểm tra độc lập cho thấy Ember-1 của Fireworks Research có độ chính xác tương đương Kimi K3 nhưng sử dụng ít token suy luận hơn và chạy nhanh gấp 3,4 lần.

Được dịch tự động từ bản gốc tiếng Anh.

Fireworks Research đã phát hành Ember-1 vào ngày 23 tháng 9 dưới dạng bản xem trước nghiên cứu, được xây dựng dựa trên mô hình mã nguồn mở Kimi K3 của Moonshot. Các thử nghiệm độc lập tiết lộ rằng Ember-1 đạt độ chính xác gần như tương đồng với mô hình gốc, đồng thời giảm mức tiêu thụ token suy luận và cải thiện đáng kể tốc độ suy luận. Kết quả này gợi ý một hướng đi khả thi cho các nhà phát triển tìm kiếm chất lượng suy luận cao mà không phải chịu độ trễ cực lớn thường gặp ở các mô hình tư duy sâu.

Điều gì đã xảy ra

Lời khẳng định cốt lõi đằng sau Ember-1 là nó học cách loại bỏ các bước suy luận không cần thiết trong khi vẫn giữ lại những tư duy quan trọng cần thiết cho các tác vụ phức tạp. Vì token suy luận được tính phí như đầu ra, việc giảm số lượng này sẽ giúp hạ thấp chi phí. Fireworks định giá Ember-1 ở mức $3 mỗi triệu token đầu vào và $15 mỗi triệu token đầu ra trên nền tảng của họ. Mặc dù mức giá này ngang bằng với giá của Fireworks dành cho Kimi K3, các nhà cung cấp khác cung cấp Kimi K3 với giá chỉ từ $1 mỗi triệu token đầu vào và $9 mỗi triệu token đầu ra. Sự chênh lệch về giá cả này có nghĩa là khoản tiết kiệm chi phí thô phụ thuộc rất nhiều vào nhà cung cấp được lựa chọn, khiến hiệu suất và tốc độ trở thành những yếu tố khác biệt chính của Ember-1.

Để đánh giá các tuyên bố này, một bài kiểm tra chuẩn độc lập đã thử nghiệm cả hai mô hình trên ba tác vụ tăng dần độ khó: câu đố logic, lập lịch triển khai và tính toán xác suất. Mỗi bài kiểm tra được chạy năm lần cho mỗi mô hình để đảm bảo tính nhất quán. Các câu đố logic liên quan đến việc phân công máy chủ cho các kỹ sư dựa trên các ràng buộc cụ thể, với độ phức tạp tăng từ bốn lên bảy kỹ sư. Tác vụ lập lịch triển khai yêu cầu tìm ra quy trình triển khai nhanh nhất cho mười hai dịch vụ có các phụ thuộc và khoảng thời gian ngừng hoạt động (blackout windows). Bài kiểm tra xác suất yêu cầu đưa ra các phân số chính xác liên quan đến một hệ thống thử lại (retry system) có bộ ngắt mạch (circuit breaker), được xác minh thông qua mô phỏng hai triệu yêu cầu.

Kết quả cho thấy Ember-1 giải quyết hoàn hảo 14 trong số 15 lần chạy, trong khi Kimi K3 đạt điểm tuyệt đối 15/15. Lỗi duy nhất của Ember-1 xảy ra trong bài kiểm tra xác suất, nơi một sai sót nhỏ về số học dẫn đến các câu trả lời sau đó bị sai. Bất chấp sự tương đồng gần như hoàn hảo về độ chính xác, Ember-1 thể hiện lợi thế đáng kể về hiệu quả. Nó sử dụng ít hơn 23% token suy luận tổng thể và hoàn thành bộ bài kiểm tra nhanh gấp 3,4 lần so với Kimi K3. Trên nền tảng Fireworks, hiệu quả này chuyển đổi thành tổng chi phí $2,48 cho Ember-1 so với $3,26 cho Kimi K3.

Cách thức hoạt động

Ember-1 được xây dựng trực tiếp trên nền tảng Kimi K3 của Moonshot, một mô hình mã nguồn mở nổi tiếng với khả năng suy luận mạnh mẽ nhưng cũng chậm chạp về tốc độ suy luận. Kỹ thuật tối ưu hóa tập trung vào việc tạo token trong giai đoạn suy luận. Thay vì tạo ra các chuỗi suy nghĩ dài cho mọi vấn đề, Ember-1 cố gắng xác định và bỏ qua các bước logic dư thừa. Quá trình này làm giảm số lượng token đầu ra được tạo ra, ảnh hưởng trực tiếp đến cả hóa đơn và độ trễ.

Vì token suy luận được tính phí như đầu ra, bất kỳ sự giảm thiểu nào về độ dài tư duy đều làm giảm chi phí ngay lập tức cho mỗi truy vấn khi sử dụng các nhà cung cấp tính phí theo token. Tuy nhiên, những thay đổi kiến trúc cũng dường như giúp tinh gọn đồ thị tính toán, dẫn đến thời gian thực tế (wall-clock time) nhanh hơn. Trong bài kiểm tra chuẩn, thời gian phản hồi trung bình của Ember-1 cho các câu đố logic phức tạp là dưới bốn phút, trong khi Kimi K3 mất hơn mười hai phút. Sự khác biệt về tốc độ này rất quan trọng đối với các ứng dụng tương tác, nơi thời gian chờ đợi của người dùng cần được tối thiểu hóa.

Chi tiết chính

  • Ember-1 hoàn thành toàn bộ bộ bài kiểm tra nhanh gấp 3,4 lần so với Kimi K3.
  • Mô hình sử dụng ít hơn trung bình 23% token suy luận trên tất cả các bài kiểm tra.
  • Ember-1 đạt 14 lần chạy hoàn hảo trong số 15 lần, với một lỗi số học nhỏ trong phần xác suất.
  • Kimi K3 đạt 15 lần chạy hoàn hảo trong số 15 lần, thể hiện sự nhất quán cao hơn một chút trong bài kiểm tra chuẩn cụ thể này.
  • Trên Fireworks, Ember-1 có chi phí $2,48 cho bộ bài kiểm tra, so với $3,26 cho Kimi K3.
  • Nếu được định tuyến qua các nhà cung cấp rẻ hơn, Kimi K3 có thể có chi phí chỉ từ $1,96 cho cùng khối lượng công việc, thấp hơn giá của Ember-1.

Tại sao điều này quan trọng

Đối với các đội ngũ kỹ thuật xây dựng sản phẩm dựa trên AI, sự đánh đổi giữa độ chính xác, chi phí và độ trễ luôn tồn tại. Các mô hình suy luận sâu như Kimi K3 thường cung cấp độ chính xác vượt trội trên các bài toán khó nhưng phải chịu độ trễ và chi phí cao do việc tạo ra lượng lớn token. Ember-1 chứng minh rằng có thể giữ lại hầu hết các lợi ích về độ chính xác trong khi cải thiện đáng kể tốc độ. Việc tăng tốc 3,4x có thể là yếu tố quyết định giữa một tính năng tương tác hữu ích và một quy trình xử lý nền, mở rộng phạm vi các ứng dụng mà mô hình suy luận sâu có thể áp dụng hiệu quả.

Tuy nhiên, lợi ích về chi phí không phải lúc nào cũng phổ quát. Các nhà phát triển ưu tiên chi phí thấp nhất tuyệt đối thay vì tốc độ vẫn có thể đạt được mức giá tốt hơn bằng cách định tuyến Kimi K3 qua các nhà cung cấp giá rẻ trên các nền tảng như OpenRouter. Giá trị đề xuất của Ember-1 mạnh mẽ nhất đối với các trường hợp sử dụng mà thời gian phản hồi là yếu tố then chốt. Nếu một ứng dụng yêu cầu phản hồi suy luận gần như tức thì, Ember-1 cung cấp một lựa chọn thay thế hấp dẫn so với mô hình gốc chậm hơn, ngay cả khi giá mỗi token cao hơn so với các tùy chọn rẻ nhất hiện có cho Kimi K3.

Bạn có thể làm gì

  • Đánh giá Ember-1 cho các tính năng tương tác yêu cầu độ trễ dưới năm phút.
  • So sánh tổng chi phí sở hữu bằng cách tính đến thời gian phát triển được tiết kiệm nhờ chu kỳ lặp lại nhanh hơn.
  • Thử nghiệm Kimi K3 nếu bạn muốn so sánh chi phí với các nhà cung cấp ngân sách hạn chế.
  • Theo dõi các cập nhật từ Fireworks Research để biết thêm thông tin về hiệu suất và giá cả.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết