Latency
How long a request takes — the difference between an assistant that feels alive and one that feels broken.
Pour les LLM, la latence se décompose en temps jusqu’au premier token, qui détermine la vitesse perçue, et en temps de génération total. Le streaming s’attaque au premier ; des modèles plus petits et des sorties plus courtes s’attaquent au second. Les modèles de raisonnement échangent délibérément de la latence contre de la justesse.
En pratique : 400 ms jusqu’au premier mot paraît instantané ; quatre secondes d’écran vide paraissent mortes.