Foundations beginner

Inference

Running a trained model to get an answer — everything that happens after training is done.

A inferência é a fase de produção: os pesos estão congelados e o modelo apenas mapeia entrada em saída. É onde mora quase todo o custo recorrente, porque o treinamento acontece uma vez e a inferência acontece a cada requisição. Latência, preço por token e throughput são todos temas de inferência.

Na prática: Cada mensagem que você manda no ChatGPT é uma chamada de inferência; o treinamento terminou meses antes.