Tokenization
Cutting text into the tokens a model can process — and a quiet source of odd model behaviour.
Un tokenizador convierte el texto en números enteros usando un vocabulario fijo aprendido de los datos. Eso explica varias rarezas famosas: los modelos cuentan mal las letras porque nunca ven letras, y el texto que no está en inglés suele costar más tokens para el mismo significado, porque los vocabularios están sesgados hacia el inglés.
En la práctica: La misma oración en griego puede costar dos o tres veces los tokens que cuesta en inglés.