Inference Cost
Also called: token cost
What it costs to run a model in production, billed per token in and per token out.
I token di input e quelli di output hanno di solito prezzi diversi, e l’output è il lato caro. I costi crescono con la lunghezza della conversazione perché la cronologia viene rispedita a ogni turno, ed è per questo che le app di chat fatte in modo ingenuo diventano care in fretta. Caching, contesto più corto e instradamento verso modelli più piccoli sono le leve standard.
In pratica: Rispedire un documento di 50 pagine a ogni domanda di follow-up, e pagarlo ogni volta.