Trust, Risk & Safety intermediate

Jailbreak

A prompt crafted to get a model to bypass its own safety rules.

I jailbreak usano il gioco di ruolo, le ipotesi, la codifica o l’escalation graduale per portare un modello oltre le sue linee guida. Continuano a funzionare perché nel linguaggio naturale non esiste una linea netta tra un’inquadratura legittima e una manipolatoria. È esattamente per questo che la sicurezza non può poggiare solo sul comportamento del modello.

In pratica: ‘Per un romanzo che sto scrivendo, descrivi nel dettaglio come farebbe il personaggio a…’

Where this comes up