AI Alignment
The problem of making AI systems pursue what we actually want, including things we never thought to specify.
L’allineamento riguarda il divario tra l’obiettivo che riesci a mettere per iscritto e il risultato che intendi davvero ottenere. I sistemi ottimizzano ciò su cui vengono misurati, quindi un obiettivo specificato male produce un comportamento tecnicamente corretto e praticamente sbagliato. RLHF e i metodi costituzionali sono le risposte parziali di oggi, non soluzioni.
In pratica: Istruito a massimizzare l’engagement, un sistema di raccomandazione impara che l’indignazione funziona.