Building & Running AI intermediate

Batch Inference

Also called: offline inference

Running many predictions together as a job instead of one at a time in real time.

L’inferenza batch elabora una coda di input in cui la latenza non conta, usando l’hardware in modo molto più efficiente. I fornitori spesso la scontano in modo consistente. Se non c’è una persona in attesa della risposta, è la strada più economica.

In pratica: Classificare un anno di ticket di assistenza durante la notte a metà prezzo.