Trust, Risk & Safety intermediate

Evaluation (Evals)

Also called: evals

Systematic measurement of whether an AI system does what you need — your tests, not the vendor's.

Le eval sono la suite di test automatizzati per il software probabilistico: un insieme fisso di casi con gli esiti attesi, eseguito a ogni modifica. Sono l’unico modo per sapere se una modifica al prompt o un aggiornamento del modello ha migliorato le cose o ha rotto qualcosa in silenzio. I benchmark pubblici ti dicono qualcosa sul modello; le eval ti dicono qualcosa sul tuo sistema.

In pratica: 200 ticket reali con le risposte corrette, eseguiti a ogni modifica del prompt.