Trust, Risk & Safety intermediate

Evaluation (Evals)

Also called: evals

Systematic measurement of whether an AI system does what you need — your tests, not the vendor's.

Les evals sont la suite de tests automatisés d’un logiciel probabiliste : un ensemble fixe de cas avec les résultats attendus, exécuté à chaque changement. C’est le seul moyen de savoir si un ajustement de prompt ou une montée de version du modèle a aidé ou a discrètement cassé quelque chose. Les benchmarks publics vous renseignent sur le modèle ; les evals vous renseignent sur votre système.

En pratique : 200 tickets réels avec les bonnes réponses, passés à chaque changement de prompt.