Trust, Risk & Safety intermediate

AI Alignment

The problem of making AI systems pursue what we actually want, including things we never thought to specify.

Alignment beschreibt die Lücke zwischen dem Ziel, das du aufschreiben kannst, und dem Ergebnis, das du eigentlich meinst. Systeme optimieren das, woran sie gemessen werden, ein schlecht formuliertes Ziel erzeugt also technisch korrektes, praktisch falsches Verhalten. RLHF und konstitutionelle Verfahren sind derzeitige Teilantworten, keine Lösungen.

In der Praxis: Auf maximale Interaktion getrimmt, lernt ein Empfehlungssystem, dass Empörung funktioniert.

Where this comes up