Tokenization
Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.
Ein Tokenizer bildet Text mit einem festen, aus Daten gelernten Vokabular auf ganze Zahlen ab. Das erklärt mehrere bekannte Eigenheiten: Modelle zählen Buchstaben falsch, weil sie nie Buchstaben sehen, und nicht-englischer Text kostet für dieselbe Bedeutung oft mehr Token, weil die Vokabulare zum Englischen tendieren.
In der Praxis: Derselbe Satz kostet auf Griechisch zwei- bis dreimal so viele Token wie auf Englisch.