Latency
How long a request takes — the difference between an assistant that feels alive and one that feels broken.
Per gli LLM la latenza si divide in tempo al primo token, che governa la velocità percepita, e tempo totale di generazione. Lo streaming aggredisce il primo; modelli più piccoli e output più brevi aggrediscono il secondo. I modelli di ragionamento scambiano di proposito latenza con accuratezza.
In pratica: 400ms alla prima parola sembrano istantanei; quattro secondi di schermo vuoto sembrano un guasto.