Trust, Risk & Safety intermediate

Red Teaming

Deliberately attacking your own AI system to find failures before someone else does.

Le red teaming est un test adverse : des personnes cherchent à faire produire au modèle des sorties nuisibles, fausses ou hors politique, et les constats reviennent alimenter l’entraînement et les garde-fous. Il se distingue de l’évaluation classique par son caractère créatif et ouvert, plutôt que noté sur un jeu figé. Pour les modèles de pointe, c’est de plus en plus une attente réglementaire.

En pratique : Vingt personnes passant une semaine à essayer de faire promettre à un bot de support des remboursements qu’il ne peut pas honorer.

Where this comes up