Batch Inference
Also called: offline inference
Running many predictions together as a job instead of one at a time in real time.
Batch-Inferenz verarbeitet eine Warteschlange von Eingaben, bei denen Latenz keine Rolle spielt, und nutzt die Hardware dabei deutlich effizienter. Anbieter geben darauf oft kräftige Rabatte. Wenn kein Mensch auf die Antwort wartet, ist das der günstigere Weg.
In der Praxis: Ein Jahr an Support-Tickets über Nacht klassifizieren, zum halben Preis.