Xây dựng với AI

Transformer cấp độ byte học được các trừu tượng nội tại và mở rộng quy mô hiệu quả

Các nhà nghiên cứu chỉ ra rằng mô hình byte không cần tokenizer vượt trội hơn mô hình subword khi mở rộng quy mô nhờ tự học cấu trúc văn bản cục bộ, giúp tăng tốc giải mã suy đoán (speculative decoding).

A glass cube containing binary digits turning into geometric blocks.
Minh họa được tạo riêng cho bài viết này

Được dịch tự động từ bản gốc tiếng Anh.

Các nhà nghiên cứu từ Đại học Sư phạm Đông Trung Quốc và Đại học Fudan đã chứng minh rằng các mô hình transformer xử lý văn bản ở cấp độ byte có thể vượt qua các tokenizer subword truyền thống khi được mở rộng quy mô đúng cách. Nghiên cứu công bố vào tháng 10 năm 2026 tiết lộ rằng những mô hình này ngầm học các trừu tượng văn bản và đạt hiệu suất vượt trội trong các tác vụ chi tiết mà không cần dựa vào các cơ chế tách từ (tokenization) bên ngoài.

Điều gì đã xảy ra

Nhóm nghiên cứu đã điều tra xem việc tăng độ dài chuỗi vốn có trong mô hình hóa cấp độ byte, thường bị coi là gánh nặng tính toán, liệu có thể đóng vai trò như một trục mở rộng quy mô hữu ích hay không. Họ đã huấn luyện các kiến trúc transformer phẳng mà không sử dụng hệ thống phân cấp cục bộ-toàn cầu chuyên biệt, so sánh chúng với các mô hình subword tiêu chuẩn. Bằng cách áp dụng kỹ thuật huấn luyện chồng lấp token (token-superposition training) và nhúng băm (hash embeddings), các transformer dựa trên byte liên tục vượt trội hơn các đối thủ subword khi kích thước mô hình tăng lên.

Nghiên cứu cũng khám phá cách các mô hình này quản lý việc phân bổ thông tin. Các nhà nghiên cứu phát hiện ra rằng transformer byte tự nhiên phát triển các trừu tượng văn bản cục bộ tương tự như những gì được cung cấp bởi các tokenizer tường minh. Những cấu trúc mới nổi này cho phép các mô hình tập trung sự bất định gần các ranh giới cụ thể, điều có thể được khai thác trong quá trình suy luận. Điều này thách thức quan điểm cho rằng các tokenizer cố định là cần thiết để mô hình hóa ngôn ngữ hiệu quả, gợi ý rằng các kiến trúc tiêu chuẩn có thể khôi phục trực tiếp các trừu tượng hữu ích từ dữ liệu thô dạng byte.

Cách hoạt động

Các mô hình cấp độ byte xử lý văn bản dưới dạng chuỗi các byte riêng lẻ thay vì các subword được nhóm lại, dẫn đến các chuỗi dài gấp khoảng bốn lần. Để quản lý điều này, các nhà nghiên cứu đã sử dụng kỹ thuật huấn luyện chồng lấp token, trung bình hóa các vector nhúng của các token liên tiếp để tăng hiệu quả tiếp xúc trong các giai đoạn huấn luyện ban đầu. Họ cũng bổ sung các vector nhúng byte bằng các vector nhúng băm, cho phép mỗi byte tích hợp ngữ cảnh từ các mẫu đa byte lân cận. Phương pháp này mở rộng trường tiếp nhận cục bộ mà không làm thay đổi kiến trúc transformer cốt lõi.

Khi mô hình được huấn luyện, nó học cách xác định các vị trí giống như điểm phân đoạn, nơi các biểu diễn ngữ cảnh cục bộ được thu thập. Các nhà nghiên cứu phát hiện ra rằng việc hạn chế tối đa 25% các lớp trung gian chỉ truy cập vào các biểu diễn cục bộ này vẫn duy trì được hiệu suất hạ nguồn. Điều này chỉ ra rằng hệ thống phân cấp giữa trừu tượng cục bộ và suy luận toàn cầu xuất hiện ngầm định bên trong mô hình. Trong quá trình tạo sinh, sự bất định không đồng đều; nó tập trung gần các ranh giới của các cấu trúc cục bộ đã học, khiến một số vị trí byte dễ dự đoán hơn nhiều so với những vị trí khác.

Chi tiết chính

  • Transformer byte vượt trội hơn các mô hình subword khi số lượng tham số tăng lên, nếu áp dụng các kỹ thuật huấn luyện phù hợp như chồng lấp token và nhúng băm.
  • Với ngân sách tính toán cố định, các mô hình byte tối ưu phân bổ khoảng 3,2 lần số byte nguồn trên mỗi tham số so với các mô hình subword.
  • Các mô hình đạt mức cải thiện tương đối khoảng 40% trên điểm CUTE và 20% trên OCRBench, cho thấy khả năng nhận thức chi tiết mạnh mẽ hơn.
  • Các cấu trúc cục bộ đã học cho phép giải mã suy đoán chấp nhận số lượng token gấp 3,4 lần so với transformer subword, giúp tăng đáng kể tốc độ suy luận.
  • Việc hạn chế tối đa 25% các lớp trung gian vào các biểu diễn cục bộ vẫn duy trì hiệu suất, xác nhận sự xuất hiện của các trừu tượng nội tại.
  • Kiến trúc hỗn hợp chuyên gia thưa (sparse mixture-of-experts) cải thiện thêm hiệu quả của mô hình byte, với một mô hình MoE byte 1B vượt trội hơn mô hình subword đặc 3B về mặt bits per byte.

Tại sao điều này quan trọng

Đối với các kỹ sư xây dựng mô hình ngôn ngữ lớn, nghiên cứu này gợi ý rằng việc loại bỏ tokenizer không nhất thiết đòi hỏi các kiến trúc mới phức tạp. Thay vào đó, các transformer tiêu chuẩn có thể được điều chỉnh để xử lý hiệu quả dữ liệu cấp độ byte thông qua các điều chỉnh huấn luyện cụ thể. Điều này đơn giản hóa quy trình bằng cách loại bỏ nhu cầu huấn luyện và bảo trì tokenizer riêng biệt, đồng thời có thể mang lại hiệu suất tốt hơn trong các tác vụ đòi hỏi hiểu biết chính xác ở cấp độ ký tự, chẳng hạn như tạo mã hoặc nhận dạng ký tự quang học (OCR).

Các phát hiện cũng nêu bật một hướng đi mới để tối ưu hóa chi phí suy luận. Bằng cách tận dụng độ khó không đồng đều của việc tạo sinh byte, các nhà phát triển có thể triển khai các chiến lược giải mã suy đoán hiệu quả hơn. Khả năng các mô hình byte chấp nhận nhiều token phác thảo hơn có nghĩa là ít bước xác minh hơn cần thiết, giảm độ trễ và mức sử dụng tính toán trong quá trình triển khai. Điều này biến mô hình hóa cấp độ byte thành một lựa chọn khả thi cho các ứng dụng thông lượng cao, nơi tốc độ và độ chính xác là yếu tố then chốt.

Bạn có thể làm gì

  • Thử nghiệm với kỹ thuật huấn luyện chồng lấp token trong 30% đầu tiên của quá trình huấn luyện để cải thiện hiệu quả học tập trên các chuỗi byte dài.
  • Triển khai nhúng băm để bổ sung cho các biểu diễn byte, cho phép mô hình nắm bắt các mẫu đa byte cục bộ.
  • Phương pháp này mở rộng trường tiếp nhận cục bộ mà không làm thay đổi kiến trúc transformer cốt lõi.
  • Khi mô hình được huấn luyện, nó học cách xác định các vị trí giống như điểm phân đoạn, nơi các biểu diễn ngữ cảnh cục bộ được thu thập.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết