Les transformeurs au niveau des octets apprennent des abstractions internes et montent en échelle efficacement
Des chercheurs montrent que les modèles sans tokenizer, fonctionnant sur les octets, surpassent les modèles à sous-mots à grande échelle en apprenant internement les structures locales du texte, ce qui permet un décodage spéculatif plus rapide.
