Trust, Risk & Safety intermediate

Red Teaming

Deliberately attacking your own AI system to find failures before someone else does.

El red teaming es prueba adversaria: hay personas que intentan que el modelo produzca salidas dañinas, falsas o fuera de política, y los hallazgos vuelven al entrenamiento y a las barreras de protección. Se diferencia de la evaluación normal por ser creativo y abierto, en lugar de puntuarse contra un conjunto fijo. Para los modelos de frontera es cada vez más una expectativa regulatoria.

En la práctica: Veinte personas dedicando una semana a lograr que un bot de soporte prometa reembolsos que no puede cumplir.

Where this comes up