Generative AI & LLMs intermediate

Tokenization

Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.

Ein Tokenizer bildet Text mit einem festen, aus Daten gelernten Vokabular auf ganze Zahlen ab. Das erklärt mehrere bekannte Eigenheiten: Modelle zählen Buchstaben falsch, weil sie nie Buchstaben sehen, und nicht-englischer Text kostet für dieselbe Bedeutung oft mehr Token, weil die Vokabulare zum Englischen tendieren.

In der Praxis: Derselbe Satz kostet auf Griechisch zwei- bis dreimal so viele Token wie auf Englisch.

Where this comes up