Building & Running AI intermediate

Throughput

How much work a system handles per unit of time — tokens per second, requests per minute.

Il throughput è la questione della capacità, distinta dalla questione della velocità posta dalla latenza. Il batching alza il throughput alzando la latenza individuale, che è esattamente il compromesso che vuoi per i job offline ed esattamente quello sbagliato per la chat.

In pratica: Metti in batch un milione di classificazioni durante la notte; nessuno sta guardando l’orologio.