Olmo-core 3 mở rộng quy mô đào tạo mixture-of-experts lên hàng nghìn tỷ tham số
Hugging Face ra mắt Olmo-core 3, một hạ tầng mã nguồn mở giúp tăng thông lượng đào tạo MoE và hỗ trợ các mô hình có tổng số tham số vượt quá một nghìn tỷ.
Được dịch tự động từ bản gốc tiếng Anh.
Hugging Face đã phát hành Olmo-core 3, một bản cập nhật lớn cho framework mã nguồn mở dùng để đào tạo các mô hình ngôn ngữ lớn. Được công bố vào ngày 1 tháng 10 năm 2026, phiên bản này giới thiệu một hệ thống được thiết kế lại, tối ưu hóa riêng cho kiến trúc mixture-of-experts (MoE), cho phép mở rộng hiệu quả lên phạm vi hàng nghìn tỷ tham số.
Điều gì đã xảy ra
Bản phát hành này giải quyết một nút thắt cổ chai quan trọng trong phát triển AI hiện đại: chi phí cao và mức tiêu thụ năng lượng lớn khi đào tạo các mô hình khổng lồ. Mặc dù các mô hình MoE cung cấp hiệu quả lý thuyết bằng cách chỉ kích hoạt một tập hợp con các tham số cho mỗi đầu vào, nhưng chi phí phối hợp giữa các chuyên gia (experts) trên các cụm GPU thường làm giảm những lợi ích đó. Olmo-core 3 nhắm đến việc thu hẹp khoảng cách này bằng cách tái tư duy về cách phân bổ dữ liệu và trọng số mô hình trong quá trình đào tạo.
Trong các bài kiểm tra nội bộ, framework mới đã chứng minh những cải thiện hiệu suất đáng kể. Khi tăng số lượng chuyên gia từ 8 lên 128 trong khi giữ nguyên số tham số hoạt động trên mỗi token ở mức khoảng 3,2 tỷ, tổng dung lượng tham số đã tăng từ 4,6 tỷ lên 47 tỷ. Bất chấp sự gia tăng khổng lồ về kích thước mô hình này, thông lượng đào tạo giảm chưa tới 5 phần trăm. Hạ tầng cũng đã được thử nghiệm ở quy mô vượt quá một nghìn tỷ tổng tham số.
Sự tiến hóa này đánh dấu bước chuyển mình so với các phiên bản trước. Trong khi Olmo 3 sử dụng kiến trúc dày đặc (dense architecture) nơi hầu hết các tham số đều hoạt động cho mỗi token, Olmo-core 3 được xây dựng ngay từ đầu cho các thiết kế MoE thưa (sparse). Nó thay thế phương pháp song song hóa dữ liệu hoàn toàn phân mảnh (fully sharded data parallelism) trước đó bằng một hệ thống dựa trên song song hóa dữ liệu phân tán (distributed data parallelism), giữ các chuyên gia nằm sẵn trên GPU để tránh việc thu thập trọng số lặp đi lặp lại.
Cách thức hoạt động
Olmo-core 3 phân phối mô hình và trạng thái đào tạo của nó trên phần cứng bằng ba kỹ thuật chính. Song song hóa chuyên gia (Expert parallelism) trải đều các thành phần chuyên biệt trên các GPU khác nhau, sao cho mỗi thiết bị chỉ lưu trữ một phần nhỏ của tổng số chuyên gia. Song song hóa đường ống (Pipeline parallelism) chia các lớp mô hình thành các nhóm GPU, giảm yêu cầu bộ nhớ trên mỗi thiết bị. Một bộ tối ưu hóa phân tán (distributed optimizer) tiết kiệm thêm bộ nhớ bằng cách trải trạng thái của bộ tối ưu hóa ra toàn bộ cụm máy chủ thay vì nhân bản nó trên từng GPU.
Để giảm thiểu chi phí giao tiếp, framework áp dụng nhiều tối ưu hóa. Song song hóa chuyên gia theo hàng (Rowwise expert parallelism) đặt dữ liệu định tuyến trực tiếp vào các bộ đệm đầu vào của chuyên gia, giảm chi phí sắp xếp lại dữ liệu. Định tuyến nằm trên GPU (GPU-resident routing) giữ siêu dữ liệu trên bộ xử lý đồ họa, cho phép CPU xếp hàng công việc mà không phải chờ đợi truyền tải dữ liệu. Ngoài ra, các thao tác GEMM nhóm (grouped GEMM operations) kết hợp nhiều tính toán nhỏ thành các lô lớn hơn, cải thiện hiệu quả thực thi trên GPU.
Hệ thống cũng hỗ trợ MXFP8, một định dạng số có độ chính xác thấp hơn giúp giảm chi phí di chuyển dữ liệu và tính toán. Trong các bài kiểm tra chuẩn trên GPU NVIDIA B300, việc bật MXFP8 đã tăng thông lượng đào tạo khoảng 21 phần trăm so với cơ sở BF16, đồng thời giảm mức sử dụng bộ nhớ hoạt động đỉnh. Các tính năng này phối hợp cùng nhau để cân bằng sự đánh đổi giữa tốc độ tính toán và độ trễ truyền tải dữ liệu.
Chi tiết chính
- Olmo-core 3 đạt thông lượng cao gấp 2,7 lần so với phiên bản tiền nhiệm trong các thử nghiệm sơ bộ trên tám GPU NVIDIA B300.
- Framework hỗ trợ các mô hình có tổng số tham số vượt quá một nghìn tỷ, được chứng minh qua bài kiểm tra với 58,36 tỷ tham số hoạt động trên mỗi token.
- Việc sử dụng độ chính xác MXFP8 đã cải thiện thông lượng thêm 21 phần trăm và giảm bộ nhớ đỉnh từ 103 GiB xuống còn 95 GiB trong các bài kiểm tra chuẩn được kiểm soát.
- Hệ thống xác định một hiện tượng gọi là "token gerrymandering" (phân vùng token thiên vị), nơi điểm số định tuyến cải thiện ngay cả khi sự cân bằng khối lượng công việc trở nên tồi tệ hơn.
- Việc chồng lấn giao tiếp và tính toán trên các luồng GPU riêng biệt không phải lúc nào cũng tăng tốc độ và đôi khi làm chậm quá trình thực thi.
- Việc hạ thấp tốc độ học (learning rates) cho các chuyên gia không cải thiện kết quả trong các họ mô hình được thử nghiệm, trái ngược với một số giả định phổ biến.
Tại sao điều này quan trọng
Đối với các đội ngũ kỹ sư xây dựng hệ thống AI quy mô lớn, Olmo-core 3 cung cấp một lựa chọn thay thế minh bạch cho các stack đào tạo độc quyền như Megatron-Core của NVIDIA. Bằng cách mã nguồn mở hạ tầng đằng sau các mô hình thế hệ tiếp theo, Hugging Face cho phép các nhà nghiên cứu và phòng thí nghiệm nhỏ hơn thử nghiệm với kiến trúc MoE mà không bị khóa vào các hệ sinh thái nhà cung cấp cụ thể. Sự minh bạch này rất quan trọng để hiểu rõ các đặc điểm hiệu suất thực tế của các mô hình thưa.
Các phát hiện kỹ thuật bao gồm trong bản phát hành nêu bật những cạm bẫy quan trọng đối với các nhà phát triển. Ví dụ, khám phá rằng việc chồng lấn giao tiếp và tính toán đôi khi có thể làm giảm hiệu suất thách thức các heuristic tối ưu hóa tiêu chuẩn. Tương tự, quan sát thấy rằng giá trị đầu vào ảnh hưởng đến thời gian tính toán ngay cả khi kích thước ma trận không đổi gợi ý rằng việc benchmarking phải được thực hiện cẩn thận. Những hiểu biết này giúp các kỹ sư tránh được các cấu hình sai tốn kém khi mở rộng quy mô mô hình của họ.
Bạn có thể làm gì
- Xem xét báo cáo kỹ thuật Olmo-core 3 để hiểu các ablation cụ thể và lựa chọn thiết kế được thực hiện trong quá trình phát triển.
- Thử nghiệm với mã nguồn mở trên GitHub để kiểm tra các cấu hình đào tạo MoE trên phần cứng của bạn.
- Sử dụng hướng dẫn tương tác do Hugging Face cung cấp để hình dung cách dữ liệu, chuyên gia và song song hóa đường ống tương tác với nhau.
- Benchmark stack đào tạo hiện tại của bạn so với các số liệu được báo cáo, đảm bảo bạn khớp các giá trị đầu vào để có sự so sánh công bằng.
- Khảo sát tác động của độ chính xác MXFP8 đối với khối lượng công việc cụ thể của bạn để xác định xem chi phí chuyển đổi có xứng đáng với mức tăng thông lượng hay không.
- Giám sát hiện tượng "token gerrymandering" trong các số liệu định tuyến của bạn để đảm bảo điểm cân bằng tải phản ánh đúng phân phối khối lượng công việc thực tế.


