Trust, Risk & Safety beginner

Guardrails

Controls that constrain what a model can be asked or allowed to output.

Los guardrails son las capas que rodean al modelo: filtros de entrada, verificaciones de salida, delimitación de los temas permitidos, permisos de herramientas, límites de tasa. Existen porque el comportamiento del modelo es probabilístico y una instrucción en el prompt no es un mecanismo de cumplimiento. Los buenos guardrails viven en tu código, no solo en el system prompt.

En la práctica: Un filtro de salida que bloquea la respuesta si contiene algo que se parezca a un número de tarjeta.

Where this comes up