Trust, Risk & Safety beginner

AI Safety

The field concerned with preventing AI systems from causing harm, from everyday failures to systemic risks.

La seguridad de la IA abarca problemas de corto plazo — un modelo que da instrucciones peligrosas, un sistema que falla en silencio en producción — y preocupaciones de más largo plazo sobre sistemas muy capaces. Es tanto práctica de ingeniería como filosofía: evaluar, hacer red teaming, monitorear y poder revertir son todo trabajo de seguridad.

En la práctica: Probar qué hace un modelo con una solicitud que debería rechazar, antes de que lo descubran los clientes.

Where this comes up