Inference
Running a trained model to get an answer — everything that happens after training is done.
L’inférence est la phase de production : les poids sont figés et le modèle se contente de transformer une entrée en sortie. C’est là que vit la quasi-totalité du coût récurrent, car l’entraînement n’a lieu qu’une fois quand l’inférence a lieu à chaque requête. La latence, le prix par token et le débit sont tous des sujets d’inférence.
En pratique : Chaque message que vous envoyez dans ChatGPT est un appel d’inférence ; l’entraînement, lui, s’est achevé des mois plus tôt.