Trust, Risk & Safety beginner

Guardrails

Controls that constrain what a model can be asked or allowed to output.

Guardrails sind die Schichten rund um das Modell: Eingabefilter, Ausgabeprüfungen, Eingrenzung erlaubter Themen, Tool-Berechtigungen, Rate Limits. Es gibt sie, weil Modellverhalten probabilistisch ist und eine Anweisung im Prompt keine Durchsetzung darstellt. Gute Guardrails leben in deinem Code, nicht nur im System-Prompt.

In der Praxis: Ein Ausgabefilter, der die Antwort blockiert, wenn sie irgendetwas enthält, das nach einer Kartennummer aussieht.

Where this comes up