Building & Running AI intermediate

Batch Inference

Also called: offline inference

Running many predictions together as a job instead of one at a time in real time.

La inferencia por lotes procesa una cola de entradas donde la latencia no importa, y aprovecha el hardware de forma mucho más eficiente. Los proveedores suelen darle un descuento considerable. Si no hay una persona esperando la respuesta, es el camino más barato.

En la práctica: Clasificar un año de tickets de soporte durante la noche a mitad de precio.