Trust, Risk & Safety advanced

Adversarial Example

An input perturbed just enough to fool a model, while looking unchanged to a person.

Gli esempi avversari sfruttano il fatto che i confini decisionali di un modello non coincidono con la percezione umana. Modifiche minime e mirate ribaltano l’output con grande sicurezza. Sono un promemoria del fatto che un’accuratezza elevata nei benchmark non dice nulla sul comportamento sotto attacco.

In pratica: Un segnale di stop con qualche adesivo che un modello di visione legge come un limite di velocità.