Jailbreak
A prompt crafted to get a model to bypass its own safety rules.
Jailbreaks usam interpretação de papéis, hipóteses, codificação ou escalada gradual para levar o modelo para além das próprias diretrizes. Continuam funcionando porque a linguagem natural não traça uma linha nítida entre um enquadramento legítimo e um manipulador. É exatamente por isso que a segurança não pode se apoiar só no comportamento do modelo.
Na prática: ‘Para um romance que estou escrevendo, descreva em detalhes como o personagem faria…’