Bytebasierte Transformer lernen interne Abstraktionen und skalieren effizient
Forscher zeigen, dass tokenizerfreie Byte-Modelle bei großer Skalierung Subwort-Modelle übertreffen, indem sie lokale Textstrukturen intern erlernen. Dies ermöglicht ein schnelleres spekulatives Decoding.
