Trust, Risk & Safety intermediate

Evaluation (Evals)

Also called: evals

Systematic measurement of whether an AI system does what you need — your tests, not the vendor's.

Evals sind die automatisierte Testsuite für probabilistische Software: ein fester Satz an Fällen mit erwarteten Ergebnissen, ausgeführt bei jeder Änderung. Nur so erfährst du, ob eine Prompt-Anpassung oder ein Modellwechsel geholfen oder still und leise etwas kaputt gemacht hat. Öffentliche Benchmarks sagen dir etwas über das Modell, Evals sagen dir etwas über dein System.

In der Praxis: 200 echte Tickets mit korrekten Antworten, laufen gelassen bei jeder Prompt-Änderung.