Trust, Risk & Safety intermediate

AI Alignment

The problem of making AI systems pursue what we actually want, including things we never thought to specify.

O alinhamento cobre a distância entre o objetivo que você consegue escrever e o resultado que você de fato pretende. Sistemas otimizam aquilo em que são medidos, então um objetivo mal especificado produz um comportamento tecnicamente correto e praticamente errado. RLHF e métodos constitucionais são respostas parciais atuais, não soluções.

Na prática: Instruído a maximizar engajamento, um sistema de recomendação aprende que a indignação funciona.

Where this comes up