Latency
How long a request takes — the difference between an assistant that feels alive and one that feels broken.
Em LLMs, a latência se divide em tempo até o primeiro token, que determina a velocidade percebida, e tempo total de geração. O streaming ataca o primeiro; modelos menores e saídas mais curtas atacam o segundo. Modelos de raciocínio trocam latência por acurácia de propósito.
Na prática: 400ms até a primeira palavra parece instantâneo; quatro segundos de tela em branco parece morto.