Inference
Running a trained model to get an answer — everything that happens after training is done.
Inferenz ist die Produktivphase: Die Gewichte sind eingefroren, und das Modell bildet Eingabe schlicht auf Ausgabe ab. Hier steckt fast der gesamte laufende Kostenblock, denn Training passiert einmal, Inferenz bei jeder Anfrage. Latenz, Preis pro Token und Durchsatz sind allesamt Themen der Inferenz.
In der Praxis: Jede ChatGPT-Nachricht, die du schickst, ist ein Inferenzaufruf; der Trainingslauf war Monate vorher fertig.