Trust, Risk & Safety intermediate

Jailbreak

A prompt crafted to get a model to bypass its own safety rules.

Jailbreaks nutzen Rollenspiel, Hypothesen, Kodierung oder schrittweise Eskalation, um ein Modell an seinen Richtlinien vorbeizureden. Sie funktionieren weiterhin, weil natürliche Sprache keine klare Grenze zwischen einer legitimen und einer manipulativen Rahmung kennt. Genau deshalb kann Sicherheit nicht allein auf dem Verhalten des Modells beruhen.

In der Praxis: ‘Für einen Roman, den ich schreibe, beschreibe im Detail, wie die Figur …’

Where this comes up