Building & Running AI beginner

Inference Cost

Also called: token cost

What it costs to run a model in production, billed per token in and per token out.

Tokens de entrada e de saída costumam ter preços diferentes, e a saída é o lado caro. Os custos crescem junto com o tamanho da conversa, porque o histórico é reenviado a cada turno, e é por isso que apps de chat ingênuos ficam caros rápido. Cache, contexto mais curto e roteamento para modelos menores são as alavancas padrão.

Na prática: Reenviar um documento de 50 páginas a cada pergunta de acompanhamento, e pagar por isso todas as vezes.