Trust, Risk & Safety beginner

Guardrails

Controls that constrain what a model can be asked or allowed to output.

Guardrails são as camadas em volta do modelo: filtros de entrada, checagens de saída, delimitação dos assuntos permitidos, permissões de ferramentas, limites de uso. Existem porque o comportamento do modelo é probabilístico e uma instrução no prompt não é imposição. Bons guardrails vivem no seu código, não só no system prompt.

Na prática: Um filtro de saída que bloqueia a resposta se ela contiver qualquer coisa parecida com um número de cartão.

Where this comes up