AI Alignment
The problem of making AI systems pursue what we actually want, including things we never thought to specify.
La alineación cubre la brecha entre el objetivo que puedes escribir y el resultado que en realidad pretendes. Los sistemas optimizan aquello con lo que se los mide, así que un objetivo mal especificado produce un comportamiento técnicamente correcto y prácticamente equivocado. El RLHF y los métodos constitucionales son respuestas parciales actuales, no soluciones.
En la práctica: Con la instrucción de maximizar la interacción, un recomendador aprende que la indignación funciona.