Building & Running AI beginner

Inference Cost

Also called: token cost

What it costs to run a model in production, billed per token in and per token out.

Les tokens d’entrée et de sortie sont généralement tarifés différemment, la sortie étant le côté cher. Les coûts augmentent avec la longueur de la conversation, puisque l’historique est renvoyé à chaque tour, ce qui explique pourquoi les applications de chat naïves deviennent vite ruineuses. Le cache, un contexte plus court et le routage vers des modèles plus petits sont les leviers habituels.

En pratique : Renvoyer un document de 50 pages à chaque question de suivi, et le payer à chaque fois.