Dust: Phương pháp tiền huấn luyện transformer bậc không cạnh tranh với backprop
Các nhà nghiên cứu giới thiệu Dust, một thuật toán tối ưu hóa bậc không (zeroth-order) thay vì làm nhiễu trọng số thì lại làm nhiễu các kích hoạt (activations) để huấn luyện transformer mà không cần lan truyền ngược (backpropagation), cho thấy hiệu suất cạnh t
Được dịch tự động từ bản gốc tiếng Anh.
Một bài báo nghiên cứu mới giới thiệu Dust, một phương pháp tối ưu hóa bậc không có khả năng tiền huấn luyện các mô hình ngôn ngữ transformer mà không phụ thuộc vào lan truyền ngược. Được công bố vào đầu tháng 10 năm 2026, công trình này thách thức giả định lâu đời rằng các phương pháp dựa trên gradient vi phân là điều kiện bắt buộc để huấn luyện các mạng nơ-ron quy mô lớn. Các tác giả chứng minh rằng bằng cách làm nhiễu các kích hoạt thay vì trọng số, Dust có thể đạt được và đôi khi vượt qua hiệu suất của phương pháp lan truyền ngược truyền thống trong các môi trường dồi dào tài nguyên tính toán.
Điều gì đã xảy ra
Học sâu từ trước đến nay vẫn phụ thuộc vào lan truyền ngược, một kỹ thuật tính toán gradient bằng cách di chuyển ngược qua các lớp của mạng. Yêu cầu về tính khả vi này đã định hình gần như mọi khía cạnh của cơ sở hạ tầng AI hiện đại, từ thiết kế phần cứng đến việc lựa chọn bộ tối ưu hóa. Tuy nhiên, các nhà nghiên cứu đứng sau Dust lập luận rằng khi năng lực tính toán toàn cầu tăng lên, các phương pháp tìm kiếm vét cạn (brute-force search) cuối cùng có thể sẽ vượt trội hơn các phương pháp gradient giải tích. Họ trích dẫn "bài học cay đắng" (bitter lesson) trong lịch sử AI, nơi các phương pháp chung chung có khả năng mở rộng theo tài nguyên tính toán thường chiến thắng những phương pháp dựa trên các thiên kiến quy nạp do con người thiết kế cụ thể.
Nhóm nghiên cứu trình bày Dust như phương pháp bậc không đầu tiên thực sự cạnh tranh được với lan truyền ngược trong việc tiền huấn luyện transformer. Các phương pháp bậc không thường ước lượng gradient bằng cách lấy mẫu cảnh quan hàm mất mát (loss landscape), nhưng chúng vốn quá kém hiệu quả đối với các mô hình lớn. Dust khắc phục điều này bằng cách đưa ra khái niệm "quần thể ảo" (virtual population). Thay vì tạo nhiều bản sao của mô hình với các trọng số hơi khác nhau, nó làm nhiễu các kích hoạt tại từng token độc lập trong một lần chạy forward duy nhất. Điều này cho phép mỗi token đóng vai trò như một thành viên riêng biệt của quần thể, đánh giá nhiều biến thể song song.
Kết quả chỉ ra rằng Dust xấp xỉ rất sát với lan truyền ngược khi kích thước quần thể lớn. Trong một số thiết lập thử nghiệm, nó thậm chí còn vượt qua lan truyền ngược, gợi ý rằng trong các chế độ mà tài nguyên tính toán dồi dào, các thuật toán dựa trên tìm kiếm có thể trở nên ưu việt hơn. Phương pháp này đã được kiểm tra lên đến 1 tỷ token, duy trì sự tương đồng mạnh mẽ với các ước lượng gradient của lan truyền ngược trong suốt quá trình mở rộng quy mô. Sự nhất quán này cho thấy cách tiếp cận không chỉ là một tò mò ở quy mô nhỏ mà là một hướng đi khả thi cho các hệ thống lớn hơn.
Cách thức hoạt động
Dust hoạt động bằng cách làm nhiễu các kích hoạt trong không gian nút (node space) thay vì không gian trọng số (weight space). Các chiến lược tiến hóa (evolution strategies - ES) truyền thống như EGGROLL sửa đổi trọng số của mạng, đòi hỏi phải vật lý hóa và đánh giá riêng biệt từng phiên bản bị nhiễu. Quá trình này tốn kém về mặt tính toán vì kích thước quần thể nhân trực tiếp với chi phí. Dust bỏ qua nút thắt cổ chai này bằng cách coi mỗi token trong chuỗi đầu vào là một điểm dữ liệu độc lập để làm nhiễu. Bằng cách áp dụng nhiễu vào các kích hoạt tại mỗi token, hệ thống đánh giá một quần thể ảo khổng lồ trong một lần chạy forward duy nhất.
Thuật toán gán tín dụng (credit assignment) dựa trên mức độ mỗi nhiễu giảm thiểu hàm mất mát. Nó sử dụng một quy tắc gán tín dụng chung phân phối các phần thưởng cấp độ token qua các loại lớp khác nhau trong khối transformer. Cách tiếp cận này tận dụng các phát hiện gần đây trong diễn giải cơ chế (mechanistic interpretability), gợi ý rằng các quá trình suy luận nằm trong các kích hoạt chứ không chỉ trong trọng số. Bằng cách tìm kiếm trên các kích hoạt, Dust thực chất đang thực hiện một cuộc tìm kiếm trên các đường dẫn suy luận tiềm ẩn (latent reasoning paths). Phương pháp này cũng bao gồm các chi tiết triển khai để ngăn chặn sự can thiệp giữa các module bị nhiễu, đảm bảo rằng tín hiệu vẫn rõ ràng khi kích thước quần thể tăng lên.
Chi tiết chính
- Dust là một phương pháp tối ưu hóa bậc không làm nhiễu các kích hoạt thay vì trọng số để ước lượng gradient.
- Phương pháp sử dụng một "quần thể ảo" nơi mỗi token đóng vai trò là một thành viên quần thể độc lập, được đánh giá song song trong một lần chạy forward.
- Từ 1 triệu token trở lên, Dust được ước tính hiệu quả hơn $10^3$ đến $10^4$ lần so với EGGROLL, một chiến lược tiến hóa không gian trọng số tiên tiến nhất hiện nay.
- Trái ngược với niềm tin trước đây, các mô hình lớn hơn hiệu quả hơn về mặt quần thể; một mô hình 243M tham số đã vượt qua một mô hình nhỏ hơn 120 lần ở hầu hết các kích thước quần thể.
- Các ước lượng gradient từ Dust phù hợp tốt với lan truyền ngược khi quần thể tăng trưởng, duy trì sự phù hợp này lên đến 1 tỷ token.
- Cách tiếp cận gợi ý rằng trong các chế độ dồi dào tài nguyên tính toán, các thuật toán dựa trên tìm kiếm có thể vượt qua các phương pháp dựa trên gradient bằng cách khám phá cảnh quan hàm mất mát rộng rãi hơn.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm và chuyên gia ML, nghiên cứu này mở ra một tiềm năng thoát khỏi các ràng buộc cứng nhắc của tính khả vi. Các stack học sâu hiện tại được tối ưu hóa nặng nề cho lan truyền ngược, hạn chế các loại kiến trúc có thể được huấn luyện hiệu quả. Nếu các phương pháp bậc không như Dust có thể mở rộng quy mô, các nhà phát triển có thể giành được quyền tự do sử dụng các thành phần không khả vi hoặc các kiến trúc mới vốn trước đây không thực tế. Điều này có thể dẫn đến các mô hình có khả năng tổng quát hóa tốt hơn, vì các phương pháp dựa trên tìm kiếm có thể tránh được một số cực tiểu địa phương xấu mà gradient descent thường gặp phải.
Lợi ích về hiệu quả so với các chiến lược tiến hóa truyền thống cũng đáng kể. ES không gian trọng số được coi là quá chậm đối với các mô hình ngôn ngữ lớn, nhưng cách tiếp cận dựa trên kích hoạt của Dust giảm bớt chi phí tính toán theo cấp số mũ. Điều này làm cho việc xem xét các phương pháp tiến hóa cho các nhiệm vụ tiền huấn luyện vốn trước đây là lãnh địa độc quyền của lan truyền ngược trở nên khả thi. Khi tài nguyên tính toán tiếp tục mở rộng, sự đánh đổi giữa độ chính xác giải tích và tìm kiếm vét cạn có thể nghiêng về phía sau, tái định hình cách các mô hình nền tảng được xây dựng.
Bạn có thể làm gì
- Đọc toàn bộ bài báo để hiểu công thức toán học của cơ chế quần thể ảo.
- Thử nghiệm với các triển khai transformer quy mô nhỏ sử dụng nhiễu kích hoạt để quan sát trực tiếp sự căn chỉnh gradient.
- So sánh độ ổn định huấn luyện của Dust với stochastic gradient descent tiêu chuẩn.
- Xem xét các quy tắc gán tín dụng được sử dụng trong Dust so với các phương pháp truyền thống.
- Theo dõi sự phát triển của lĩnh vực này khi tài nguyên tính toán ngày càng trở nên phổ biến.



