Red Teaming
Deliberately attacking your own AI system to find failures before someone else does.
Red Teaming ist adversariales Testen: Menschen versuchen, das Modell zu schädlichen, falschen oder regelwidrigen Ausgaben zu bringen, und die Funde fließen zurück in Training und Guardrails. Es unterscheidet sich von normaler Evaluation dadurch, dass es kreativ und ergebnisoffen ist statt gegen ein festes Set bewertet zu werden. Bei Frontier-Modellen wird es zunehmend regulatorisch erwartet.
In der Praxis: Zwanzig Leute, die eine Woche lang versuchen, einen Support-Bot dazu zu bringen, Rückerstattungen zu versprechen, die er nicht einlösen kann.