Inference Cost
Also called: token cost
What it costs to run a model in production, billed per token in and per token out.
Eingabe- und Ausgabe-Token werden meist unterschiedlich bepreist, wobei die Ausgabe die teure Seite ist. Die Kosten wachsen mit der Gesprächslänge, weil die Historie bei jedem Zug erneut mitgeschickt wird, und deshalb werden naive Chat-Apps schnell teuer. Caching, kürzerer Kontext und Routing auf kleinere Modelle sind die üblichen Hebel.
In der Praxis: Ein 50-seitiges Dokument bei jeder Rückfrage erneut mitschicken — und jedes Mal dafür bezahlen.