Trust, Risk & Safety beginner

AI Safety

The field concerned with preventing AI systems from causing harm, from everyday failures to systemic risks.

A segurança de IA abrange questões de curto prazo — um modelo dando instruções perigosas, um sistema falhando em silêncio em produção — e preocupações de longo prazo com sistemas muito capazes. É prática de engenharia tanto quanto filosofia: avaliação, red teaming, monitoramento e rollback são todos trabalho de segurança.

Na prática: Testar o que um modelo faz com um pedido que deveria recusar, antes que os clientes descubram.

Where this comes up