AI Alignment
The problem of making AI systems pursue what we actually want, including things we never thought to specify.
L’alignement couvre l’écart entre l’objectif que l’on sait écrire et le résultat que l’on vise vraiment. Les systèmes optimisent ce sur quoi on les mesure : un objectif mal spécifié produit donc un comportement techniquement correct et pratiquement mauvais. Le RLHF et les méthodes constitutionnelles sont des réponses partielles actuelles, pas des solutions.
En pratique : Chargé de maximiser l’engagement, un moteur de recommandation apprend que l’indignation fonctionne.