Inference
Running a trained model to get an answer — everything that happens after training is done.
La inferencia es la fase de producción: los pesos están congelados y el modelo simplemente mapea la entrada a la salida. Ahí vive casi todo el costo continuo, porque el entrenamiento ocurre una vez pero la inferencia ocurre en cada solicitud. La latencia, el precio por token y el throughput son todos asuntos de inferencia.
En la práctica: Cada mensaje que envías en ChatGPT es una llamada de inferencia; el entrenamiento terminó meses antes.