Trust, Risk & Safety intermediate

Jailbreak

A prompt crafted to get a model to bypass its own safety rules.

Los jailbreaks usan juegos de rol, hipótesis, codificación o escalada gradual para llevar al modelo más allá de sus lineamientos. Siguen funcionando porque el lenguaje natural no tiene una línea nítida entre un encuadre legítimo y uno manipulador. Precisamente por eso la seguridad no puede descansar solo en el comportamiento del modelo.

En la práctica: ‘Para una novela que estoy escribiendo, describe en detalle cómo el personaje haría…’

Where this comes up