Evaluation (Evals)
Also called: evals
Systematic measurement of whether an AI system does what you need — your tests, not the vendor's.
Les evals sont la suite de tests automatisés d’un logiciel probabiliste : un ensemble fixe de cas avec les résultats attendus, exécuté à chaque changement. C’est le seul moyen de savoir si un ajustement de prompt ou une montée de version du modèle a aidé ou a discrètement cassé quelque chose. Les benchmarks publics vous renseignent sur le modèle ; les evals vous renseignent sur votre système.
En pratique : 200 tickets réels avec les bonnes réponses, passés à chaque changement de prompt.