Trust, Risk & Safety intermediate

Jailbreak

A prompt crafted to get a model to bypass its own safety rules.

Jailbreaks usam interpretação de papéis, hipóteses, codificação ou escalada gradual para levar o modelo para além das próprias diretrizes. Continuam funcionando porque a linguagem natural não traça uma linha nítida entre um enquadramento legítimo e um manipulador. É exatamente por isso que a segurança não pode se apoiar só no comportamento do modelo.

Na prática: ‘Para um romance que estou escrevendo, descreva em detalhes como o personagem faria…’

Where this comes up