Generative AI & LLMs intermediate

Tokenization

Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.

Um tokenizador mapeia texto para inteiros usando um vocabulário fixo aprendido a partir de dados. Isso explica várias esquisitices famosas: os modelos contam letras errado porque nunca veem letras, e textos fora do inglês costumam custar mais tokens para o mesmo sentido, porque os vocabulários pendem para o inglês.

Na prática: A mesma frase em grego pode custar de duas a três vezes os tokens que custa em inglês.

Where this comes up