Throughput
How much work a system handles per unit of time — tokens per second, requests per minute.
El throughput es la pregunta por la capacidad, distinta de la pregunta por la velocidad que plantea la latencia. Agrupar solicitudes en lotes sube el throughput y a la vez sube la latencia individual, que es exactamente el intercambio que quieres para trabajos offline y exactamente el equivocado para un chat.
En la práctica: Procesar por lotes un millón de clasificaciones durante la noche; nadie está mirando el reloj.