Batch Inference
Also called: offline inference
Running many predictions together as a job instead of one at a time in real time.
A inferência em lote processa uma fila de entradas em que a latência não importa, usando o hardware de forma muito mais eficiente. Os provedores costumam dar descontos generosos nela. Se ninguém está esperando a resposta, esse é o caminho mais barato.
Na prática: Classificar um ano de tickets de suporte durante a noite pela metade do preço.