Generative AI & LLMs intermediate

Tokenization

Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.

Un tokenizer transforme le texte en entiers à l’aide d’un vocabulaire fixe appris sur des données. Cela explique plusieurs bizarreries célèbres : les modèles comptent mal les lettres parce qu’ils ne voient jamais de lettres, et un texte non anglophone coûte souvent plus de tokens à sens égal, parce que les vocabulaires penchent vers l’anglais.

En pratique : La même phrase en grec peut coûter deux à trois fois plus de tokens qu’en anglais.

Where this comes up