Trust, Risk & Safety intermediate

AI Alignment

The problem of making AI systems pursue what we actually want, including things we never thought to specify.

La alineación cubre la brecha entre el objetivo que puedes escribir y el resultado que en realidad pretendes. Los sistemas optimizan aquello con lo que se los mide, así que un objetivo mal especificado produce un comportamiento técnicamente correcto y prácticamente equivocado. El RLHF y los métodos constitucionales son respuestas parciales actuales, no soluciones.

En la práctica: Con la instrucción de maximizar la interacción, un recomendador aprende que la indignación funciona.

Where this comes up