Building & Running AI beginner

Latency

How long a request takes — the difference between an assistant that feels alive and one that feels broken.

Bei LLMs zerfällt Latenz in die Zeit bis zum ersten Token, die das gefühlte Tempo bestimmt, und in die gesamte Generierungszeit. Streaming greift das Erste an; kleinere Modelle und kürzere Ausgaben greifen das Zweite an. Reasoning-Modelle tauschen absichtlich Latenz gegen Genauigkeit.

In der Praxis: 400 ms bis zum ersten Wort fühlen sich sofort an; vier Sekunden leerer Bildschirm fühlen sich tot an.