Trust, Risk & Safety beginner

Guardrails

Controls that constrain what a model can be asked or allowed to output.

I guardrail sono gli strati attorno al modello: filtri sull’input, verifiche sull’output, delimitazione degli argomenti ammessi, permessi sugli strumenti, limiti di frequenza. Esistono perché il comportamento del modello è probabilistico e un’istruzione nel prompt non è un vincolo applicato. I buoni guardrail vivono nel tuo codice, non solo nel prompt di sistema.

In pratica: Un filtro sull’output che blocca la risposta se contiene qualcosa che somiglia a un numero di carta.

Where this comes up