Trust, Risk & Safety advanced

Adversarial Example

An input perturbed just enough to fool a model, while looking unchanged to a person.

Exemplos adversariais exploram o fato de que as fronteiras de decisão de um modelo não coincidem com a percepção humana. Alterações minúsculas e direcionadas invertem a saída com alta confiança. Eles são um lembrete de que uma alta acurácia em benchmarks não diz nada sobre o comportamento sob ataque.

Na prática: Uma placa de pare com alguns adesivos que um modelo de visão lê como placa de limite de velocidade.