Building & Running AI intermediate

Batch Inference

Also called: offline inference

Running many predictions together as a job instead of one at a time in real time.

A inferência em lote processa uma fila de entradas em que a latência não importa, usando o hardware de forma muito mais eficiente. Os provedores costumam dar descontos generosos nela. Se ninguém está esperando a resposta, esse é o caminho mais barato.

Na prática: Classificar um ano de tickets de suporte durante a noite pela metade do preço.