Evaluation (Evals)
Also called: evals
Systematic measurement of whether an AI system does what you need — your tests, not the vendor's.
Evals são a suíte de testes automatizados para software probabilístico: um conjunto fixo de casos com resultados esperados, rodado a cada mudança. São a única forma de saber se um ajuste de prompt ou uma troca de modelo ajudou ou quebrou algo em silêncio. Benchmarks públicos falam do modelo; evals falam do seu sistema.
Na prática: 200 tickets reais com as respostas corretas, rodados a cada mudança de prompt.