Construir con IA

Los transformers a nivel de byte aprenden abstracciones internas y escalan con eficiencia

Investigadores demuestran que los modelos de bytes sin tokenizador superan a los modelos de subpalabras a gran escala al aprender internamente estructuras locales del texto, lo que permite una decodificación especulativa más rápida.

Un cubo de vidrio que contiene dígitos binarios transformándose en bloques geométricos.
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Investigadores de la Universidad Normal de China Oriental y la Universidad Fudan han demostrado que los modelos transformer que procesan el texto a nivel de byte pueden superar a los tokenizadores tradicionales de subpalabras cuando se escalan correctamente. Publicado en octubre de 2026, el estudio revela que estos modelos aprenden implícitamente abstracciones del texto y logran un rendimiento superior en tareas de grano fino sin depender de esquemas de tokenización externos.

Qué ocurrió

El equipo investigó si la mayor longitud de secuencia inherente al modelado a nivel de byte, a menudo vista como una carga computacional, podría servir en cambio como un eje útil para el escalado. Entrenaron arquitecturas transformer planas sin jerarquías locales-globales especializadas, comparándolas con modelos estándar de subpalabras. Mediante el uso de entrenamiento por superposición de tokens y embeddings hash, los transformers basados en bytes superaron consistentemente a sus contrapartes de subpalabras a medida que aumentaba el tamaño del modelo.

El estudio exploró además cómo manejan estos modelos la asignación de información. Los investigadores descubrieron que los transformers de bytes desarrollan naturalmente abstracciones locales del texto similares a las proporcionadas por los tokenizadores explícitos. Estas estructuras emergentes permiten a los modelos concentrar la incertidumbre cerca de límites específicos, lo cual puede explotarse durante la inferencia. Esto desafía la noción de que los tokenizadores fijos son necesarios para un modelado lingüístico efectivo, sugiriendo que las arquitecturas estándar pueden recuperar abstracciones útiles directamente desde los bytes crudos.

Cómo funciona

Los modelos a nivel de byte procesan el texto como secuencias de bytes individuales en lugar de subpalabras agrupadas, resultando en secuencias aproximadamente cuatro veces más largas. Para gestionar esto, los investigadores utilizaron el entrenamiento por superposición de tokens, que promedia los embeddings de tokens consecutivos para aumentar la eficiencia de exposición durante las primeras etapas del entrenamiento. También augmentaron los embeddings de bytes con embeddings hash, permitiendo que cada byte incorpore contexto de patrones multibyte cercanos. Este enfoque expande el campo receptivo local sin cambiar la arquitectura central del transformer.

A medida que el modelo entrena, aprende a identificar posiciones similares a segmentaciones donde se recogen representaciones de contexto local. Los investigadores descubrieron que restringir hasta el 25% de las capas intermedias para acceder solo a estas representaciones locales preservaba el rendimiento posterior. Esto indica que la jerarquía de abstracción local y razonamiento global emerge implícitamente dentro del modelo. Durante la generación, la incertidumbre no es uniforme; se concentra cerca de los límites de estas estructuras locales aprendidas, haciendo que algunas posiciones de byte sean mucho más fáciles de predecir que otras.

Detalles clave

  • Los transformers de bytes superan a los modelos de subpalabras a medida que escala el número de parámetros, dadas técnicas de entrenamiento apropiadas como la superposición de tokens y los embeddings hash.
  • Bajo un presupuesto de cómputo fijo, los modelos óptimos de bytes asignan aproximadamente 3,2 veces más bytes fuente por parámetro en comparación con los modelos de subpalabras.
  • Los modelos logran una mejora relativa de alrededor del 40% en las puntuaciones CUTE y del 20% en OCRBench, lo que indica capacidades de percepción de grano fino más fuertes.
  • Las estructuras locales aprendidas permiten que la decodificación especulativa acepte 3,4 veces más tokens que en los transformers de subpalabras, aumentando significativamente la velocidad de inferencia.
  • Restringir hasta el 25% de las capas intermedias a representaciones locales mantiene el rendimiento, confirmando la emergencia de abstracciones internas.
  • Las arquitecturas dispersas de mezcla de expertos (mixture-of-experts) mejoran aún más la eficiencia de los modelos de bytes, con un MoE de bytes de 1B superando a un modelo denso de subpalabras de 3B en bits por byte.

Por qué importa

Para los ingenieros que construyen grandes modelos de lenguaje, esta investigación sugiere que eliminar los tokenizadores no requiere necesariamente nuevas arquitecturas complejas. En su lugar, los transformers estándar pueden adaptarse para manejar datos a nivel de byte de manera efectiva mediante ajustes específicos de entrenamiento. Esto simplifica el pipeline al eliminar la necesidad de entrenar y mantener tokenizadores separados, mientras ofrece potencialmente un mejor rendimiento en tareas que requieren una comprensión precisa a nivel de carácter, como la generación de código o el reconocimiento óptico de caracteres.

Los hallazgos también destacan una nueva vía para optimizar los costos de inferencia. Al aprovechar la dificultad no uniforme de la generación de bytes, los desarrolladores pueden implementar estrategias de decodificación especulativa más eficientes. La capacidad de los modelos de bytes para aceptar más tokens borrador significa que se necesitan menos pasos de verificación, reduciendo la latencia y el uso de cómputo durante el despliegue. Esto hace que el modelado a nivel de byte sea una opción viable para aplicaciones de alto rendimiento donde la velocidad y la precisión son críticas.

Qué puedes hacer

  • Experimenta con el entrenamiento por superposición de tokens durante el primer 30% de tu ejecución de entrenamiento para mejorar la eficiencia de aprendizaje en secuencias largas de bytes.
  • Implementa embeddings hash para augmentar las representaciones de bytes, permitiendo que el modelo capture patrones locales multibyte sin aumentar el tamaño del vocabulario.
  • Evalúa tus modelos en benchmarks de grano fino como CUTE y OCRBench para evaluar mejoras en la percepción y manipulación a nivel de carácter.
  • Analiza las distribuciones de pérdida por byte para identificar los límites de las estructuras locales, lo que puede informar el diseño de borradores de decodificación especulativa más efectivos.
  • Considera usar capas dispersas de mezcla de expertos para reducir el cómputo activado mientras mantienes los beneficios de capacidad de modelos de bytes más grandes.
  • Prueba restringir el acceso en las capas intermedias a representaciones locales para verificar si están formándose abstracciones emergentes en tus propias arquitecturas.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo
$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos