Trust, Risk & Safety advanced

Adversarial Example

An input perturbed just enough to fool a model, while looking unchanged to a person.

Adversarial Examples nutzen aus, dass die Entscheidungsgrenzen eines Modells nicht mit der menschlichen Wahrnehmung übereinstimmen. Winzige, gezielte Änderungen kippen die Ausgabe, und das Modell ist sich dabei sehr sicher. Sie sind eine Erinnerung daran, dass hohe Benchmark-Genauigkeit nichts darüber aussagt, wie sich ein System unter Angriff verhält.

In der Praxis: Ein Stoppschild mit ein paar Aufklebern, das ein Vision-Modell als Tempolimit-Schild liest.