Trust, Risk & Safety beginner

AI Safety

The field concerned with preventing AI systems from causing harm, from everyday failures to systemic risks.

KI-Sicherheit reicht von kurzfristigen Themen — ein Modell, das gefährliche Anleitungen gibt, ein System, das im Betrieb stillschweigend versagt — bis zu langfristigen Fragen rund um sehr leistungsfähige Systeme. Sie ist genauso Ingenieurspraxis wie Philosophie: Evaluation, Red Teaming, Monitoring und Rollback gehören alle dazu.

In der Praxis: Testen, was ein Modell mit einer Anfrage macht, die es ablehnen sollte — bevor Kunden es herausfinden.

Where this comes up