Quantization
Storing model weights at lower numeric precision to cut memory and cost, with a small quality trade-off.
Quantisierung schrumpft jedes Gewicht von zum Beispiel 16 Bit auf 8 oder 4. Das Modell wird dramatisch kleiner und schneller, meist bei überschaubarer Verschlechterung — genau das erlaubt es, leistungsfähige Modelle auf einem Laptop oder einem Smartphone laufen zu lassen. Wie viel Qualität du verlierst, hängt von der Methode ab und davon, wie aggressiv du vorgehst.
In der Praxis: Ein 70B-Modell, so komprimiert, dass es auf einer einzelnen Consumer-GPU läuft.