Tokenization
Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.
Um tokenizador mapeia texto para inteiros usando um vocabulário fixo aprendido a partir de dados. Isso explica várias esquisitices famosas: os modelos contam letras errado porque nunca veem letras, e textos fora do inglês costumam custar mais tokens para o mesmo sentido, porque os vocabulários pendem para o inglês.
Na prática: A mesma frase em grego pode custar de duas a três vezes os tokens que custa em inglês.