Batch Inference
Also called: offline inference
Running many predictions together as a job instead of one at a time in real time.
L’inferenza batch elabora una coda di input in cui la latenza non conta, usando l’hardware in modo molto più efficiente. I fornitori spesso la scontano in modo consistente. Se non c’è una persona in attesa della risposta, è la strada più economica.
In pratica: Classificare un anno di ticket di assistenza durante la notte a metà prezzo.