Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
La cuantización reduce cada peso de, digamos, 16 bits a 8 o 4. El modelo queda mucho más pequeño y más rápido, en general con una degradación modesta, y eso es lo que permite correr modelos capaces en una laptop o un teléfono. Cuánta calidad pierdes depende del método y de qué tan agresivo seas.
En la práctica: Un modelo de 70B comprimido para correr en una sola GPU de consumo.