Foundations beginner

Inference

Running a trained model to get an answer — everything that happens after training is done.

L’inferenza è la fase di produzione: i pesi sono congelati e il modello si limita a mappare l’input sull’output. È lì che sta quasi tutto il costo ricorrente, perché l’addestramento avviene una volta sola mentre l’inferenza avviene a ogni richiesta. Latenza, prezzo per token e throughput sono tutte questioni di inferenza.

In pratica: Ogni messaggio che invii a ChatGPT è una chiamata di inferenza; l’addestramento era finito mesi prima.