Tokenization
Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.
Un tokenizer mappa il testo in numeri interi usando un vocabolario fisso appreso dai dati. Spiega diverse stranezze famose: i modelli sbagliano a contare le lettere perché non vedono mai le lettere, e i testi non in inglese costano spesso più token a parità di significato perché i vocabolari pendono verso l’inglese.
In pratica: La stessa frase in greco può costare due o tre volte i token che costa in inglese.