Les transformeurs au niveau des octets apprennent des abstractions internes et montent en échelle efficacement
Des chercheurs montrent que les modèles sans tokenizer, fonctionnant sur les octets, surpassent les modèles à sous-mots à grande échelle en apprenant internement les structures locales du texte, ce qui permet un décodage spéculatif plus rapide.
Traduit automatiquement depuis l'original anglais.
Des chercheurs de l'Université normale de Chine orientale et de l'Université Fudan ont démontré que les modèles de type transformer traitant le texte au niveau des octets peuvent surpasser les tokenizers traditionnels à sous-mots lorsqu'ils sont correctement dimensionnés. Publiée en octobre 2026, cette étude révèle que ces modèles apprennent implicitement des abstractions textuelles et atteignent une performance supérieure sur des tâches fines sans dépendre de schémas de tokenisation externes.
Ce qui s'est passé
L'équipe a étudié si la longueur accrue des séquences inhérente à la modélisation au niveau des octets, souvent considérée comme une charge informatique, pouvait plutôt servir d'axe utile pour la montée en échelle. Ils ont entraîné des architectures transformer plates sans hiérarchies locales-globales spécialisées, en les comparant aux modèles standards à sous-mots. En employant l'apprentissage par superposition de tokens et les embeddings de hachage, les transformers basés sur les octets ont systématiquement surpassé leurs homologues à sous-mots à mesure que la taille du modèle augmentait.
L'étude a également exploré la manière dont ces modèles gèrent l'allocation de l'information. Les chercheurs ont constaté que les transformers à octets développent naturellement des abstractions textuelles locales similaires à celles fournies par les tokenizers explicites. Ces structures émergentes permettent aux modèles de concentrer l'incertitude près de certaines limites spécifiques, ce qui peut être exploité lors de l'inférence. Cela remet en question l'idée selon laquelle des tokenizers fixes sont nécessaires pour une modélisation linguistique efficace, suggérant que les architectures standard peuvent récupérer des abstractions utiles directement à partir des octets bruts.
Comment cela fonctionne
Les modèles au niveau des octets traitent le texte comme des séquences d'octets individuels plutôt que de sous-mots regroupés, ce qui entraîne des séquences environ quatre fois plus longues. Pour gérer cela, les chercheurs ont utilisé l'apprentissage par superposition de tokens, qui moyenne les embeddings de tokens consécutifs pour augmenter l'efficacité de l'exposition durant les premières étapes de l'entraînement. Ils ont également augmenté les embeddings d'octets avec des embeddings de hachage, permettant à chaque octet d'intégrer le contexte de motifs multi-octets voisins. Cette approche élargit le champ réceptif local sans modifier l'architecture centrale du transformer.
Au fur et à mesure que le modèle s'entraîne, il apprend à identifier des positions de segmentation où les représentations contextuelles locales sont collectées. Les chercheurs ont découvert que restreindre jusqu'à 25 % des couches intermédiaires à l'accès uniquement à ces représentations locales préservait la performance en aval. Cela indique que la hiérarchie entre abstraction locale et raisonnement global émerge implicitement au sein du modèle. Lors de la génération, l'incertitude n'est pas uniforme ; elle se concentre près des limites de ces structures locales apprises, rendant certaines positions d'octets beaucoup plus faciles à prédire que d'autres.
Détails clés
- Les transformers à octets surpassent les modèles à sous-mots à mesure que le nombre de paramètres augmente, grâce à des techniques d'entraînement appropriées comme la superposition de tokens et les embeddings de hachage.
- Sous un budget de calcul fixe, les modèles à octets optimaux allouent environ 3,2 fois plus d'octets sources par paramètre par rapport aux modèles à sous-mots.
- Les modèles atteignent une amélioration relative d'environ 40 % sur les scores CUTE et de 20 % sur OCRBench, indiquant des capacités de perception fine plus fortes.
- Les structures locales apprises permettent au décodage spéculatif d'accepter 3,4 fois plus de tokens que dans les transformers à sous-mots, accélérant significativement la vitesse d'inférence.
- Restreindre jusqu'à 25 % des couches intermédiaires aux représentations locales maintient la performance, confirmant l'émergence d'abstractions internes.
- Les architectures éparses à mélange d'experts (mixture-of-experts) améliorent encore l'efficacité des modèles à octets, un MoE à octets de 1 Md surpassant un modèle dense à sous-mots de 3 Md en termes de bits par octet.
Pourquoi c'est important
Pour les ingénieurs construisant de grands modèles de langage, cette recherche suggère que supprimer les tokenizers ne nécessite pas nécessairement de nouvelles architectures complexes. Au contraire, les transformers standards peuvent être adaptés pour traiter efficacement les données au niveau des octets grâce à des ajustements spécifiques d'entraînement. Cela simplifie le pipeline en éliminant le besoin d'entraîner et de maintenir des tokenizers séparés, tout en offrant potentiellement de meilleures performances sur des tâches nécessitant une compréhension précise au niveau des caractères, telles que la génération de code ou la reconnaissance optique de caractères.
Les résultats mettent également en évidence une nouvelle voie pour optimiser les coûts d'inférence. En tirant parti de la difficulté non uniforme de la génération d'octets, les développeurs peuvent mettre en œuvre des stratégies de décodage spéculatif plus efficaces. La capacité des modèles à octets à accepter davantage de tokens rédigés signifie qu'il faut moins d'étapes de vérification, réduisant ainsi la latence et l'utilisation de calcul lors du déploiement. Cela fait de la modélisation au niveau des octets une option viable pour les applications à haut débit où la vitesse et la précision sont critiques.
Ce que vous pouvez faire
- Expérimentez avec l'apprentissage par superposition de tokens durant les 30 % initiaux de votre cycle d'entraînement pour améliorer l'efficacité de l'apprentissage sur de longues séquences d'octets.
- Implémentez des embeddings de hachage pour augmenter les représentations d'octets, permettant au modèle de capturer des motifs locaux multi-octets sans augmenter la taille du vocabulaire.
- Évaluez vos modèles sur des benchmarks fins comme CUTE et OCRBench pour mesurer les améliorations en matière de perception et de manipulation au niveau des caractères.
- Analysez les distributions de perte par octet pour identifier les limites des structures locales, ce qui peut informer la conception de brouillons de décodage spéculatif plus efficaces.
- Envisagez d'utiliser des couches éparses à mélange d'experts pour réduire le calcul activé tout en maintenant les avantages de capacité des modèles à octets plus grands.
- Testez la restriction de l'accès dans les couches intermédiaires aux représentations locales pour vérifier si des abstractions émergentes se forment dans vos propres architectures.



