Batch Inference
Also called: offline inference
Running many predictions together as a job instead of one at a time in real time.
La inferencia por lotes procesa una cola de entradas donde la latencia no importa, y aprovecha el hardware de forma mucho más eficiente. Los proveedores suelen darle un descuento considerable. Si no hay una persona esperando la respuesta, es el camino más barato.
En la práctica: Clasificar un año de tickets de soporte durante la noche a mitad de precio.