Generative AI & LLMs advanced

Test-Time Compute

Also called: inference-time scaling

Spending more computation at answer time — thinking longer — to get better results without retraining.

Test-time compute é o segundo eixo de escala. Em vez de um modelo maior, você deixa o modelo existente deliberar por mais tempo, gerar várias tentativas ou conferir o próprio trabalho. Isso te dá um botão ao vivo de qualidade versus custo, que antes ficava fixo no momento do treino.

Na prática: Mesmo modelo, dez vezes mais orçamento de pensamento, matemática bem melhor.

Where this comes up