Building & Running AI beginner

Latency

How long a request takes — the difference between an assistant that feels alive and one that feels broken.

En los LLM, la latencia se divide en el tiempo hasta el primer token, que determina la velocidad percibida, y el tiempo total de generación. El streaming ataca lo primero; los modelos más pequeños y las salidas más cortas atacan lo segundo. Los modelos de razonamiento cambian latencia por exactitud a propósito.

En la práctica: 400ms hasta la primera palabra se siente instantáneo; cuatro segundos de pantalla en blanco se sienten muertos.