Batch Inference
Also called: offline inference
Running many predictions together as a job instead of one at a time in real time.
L’inférence par lots traite une file d’entrées lorsque la latence n’a pas d’importance, en exploitant le matériel bien plus efficacement. Les fournisseurs la facturent souvent nettement moins cher. Si aucun humain n’attend la réponse, c’est la voie la moins coûteuse.
En pratique : Classer un an de tickets de support pendant la nuit, à moitié prix.