Transformer cấp độ byte học được các trừu tượng nội tại và mở rộng quy mô hiệu quả
Các nhà nghiên cứu chỉ ra rằng mô hình byte không cần tokenizer vượt trội hơn mô hình subword khi mở rộng quy mô nhờ tự học cấu trúc văn bản cục bộ, giúp tăng tốc giải mã suy đoán (speculative decoding).
