Los transformers a nivel de byte aprenden abstracciones internas y escalan con eficiencia
Investigadores demuestran que los modelos de bytes sin tokenizador superan a los modelos de subpalabras a gran escala al aprender internamente estructuras locales del texto, lo que permite una decodificación especulativa más rápida.
