<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Trust, Risk &amp; Safety on Coursiv Blog</title><link>https://coursiv.io/blog/tags/trust-risk--safety</link><description>Recent content in Trust, Risk &amp; Safety on Coursiv Blog</description><generator>Hugo -- 0.147.0</generator><language>en-US</language><atom:link href="https://coursiv.io/blog/tags/trust-risk--safety/index.xml" rel="self" type="application/rss+xml"/><item><title>Adversarial Example</title><link>https://coursiv.io/blog/glossary/adversarial-example</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/adversarial-example</guid><description>An input perturbed just enough to fool a model, while looking unchanged to a person.</description></item><item><title>AI Alignment</title><link>https://coursiv.io/blog/glossary/ai-alignment</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/ai-alignment</guid><description>The problem of making AI systems pursue what we actually want, including things we never thought to specify.</description></item><item><title>AI Incident</title><link>https://coursiv.io/blog/glossary/ai-incident</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/ai-incident</guid><description>An event where an AI system causes or nearly causes harm — increasingly something you must record and report.</description></item><item><title>AI Safety</title><link>https://coursiv.io/blog/glossary/ai-safety</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/ai-safety</guid><description>The field concerned with preventing AI systems from causing harm, from everyday failures to systemic risks.</description></item><item><title>Algorithmic Bias</title><link>https://coursiv.io/blog/glossary/algorithmic-bias</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/algorithmic-bias</guid><description>When a system produces systematically different outcomes for different groups, without justification.</description></item><item><title>Benchmark</title><link>https://coursiv.io/blog/glossary/benchmark</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/benchmark</guid><description>A standard test set used to compare models — useful for direction, unreliable as a guarantee.</description></item><item><title>Bias</title><link>https://coursiv.io/blog/glossary/bias</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/bias</guid><description>Systematic skew in a model&amp;#39;s outputs — a data and design property, not a moral accusation.</description></item><item><title>Content Credentials</title><link>https://coursiv.io/blog/glossary/content-credentials</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/content-credentials</guid><description>Cryptographically signed metadata recording how a piece of media was created and edited.</description></item><item><title>Data Poisoning</title><link>https://coursiv.io/blog/glossary/data-poisoning</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/data-poisoning</guid><description>Corrupting training data so the resulting model misbehaves, often only on a specific trigger.</description></item><item><title>Data Provenance</title><link>https://coursiv.io/blog/glossary/data-provenance</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/data-provenance</guid><description>A documented record of where data came from, how it was collected, and what may be done with it.</description></item><item><title>Differential Privacy</title><link>https://coursiv.io/blog/glossary/differential-privacy</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/differential-privacy</guid><description>A mathematical guarantee that a result barely changes whether or not any one person&amp;#39;s data was included.</description></item><item><title>Evaluation (Evals)</title><link>https://coursiv.io/blog/glossary/evaluation</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/evaluation</guid><description>Systematic measurement of whether an AI system does what you need — your tests, not the vendor&amp;#39;s.</description></item><item><title>Explainability</title><link>https://coursiv.io/blog/glossary/explainability</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/explainability</guid><description>Being able to give a human a meaningful account of why a system produced a particular output.</description></item><item><title>Fairness</title><link>https://coursiv.io/blog/glossary/fairness</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/fairness</guid><description>The requirement that a system treat people equitably — with several mathematical definitions that provably conflict.</description></item><item><title>Guardrails</title><link>https://coursiv.io/blog/glossary/guardrails</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/guardrails</guid><description>Controls that constrain what a model can be asked or allowed to output.</description></item><item><title>Interpretability</title><link>https://coursiv.io/blog/glossary/interpretability</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/interpretability</guid><description>Understanding how a model works internally, as opposed to just describing its outputs.</description></item><item><title>Jailbreak</title><link>https://coursiv.io/blog/glossary/jailbreak</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/jailbreak</guid><description>A prompt crafted to get a model to bypass its own safety rules.</description></item><item><title>Model Card</title><link>https://coursiv.io/blog/glossary/model-card</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/model-card</guid><description>A short standard document stating what a model is for, how it was evaluated, and where it fails.</description></item><item><title>Model Drift</title><link>https://coursiv.io/blog/glossary/model-drift</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/model-drift</guid><description>Silent degradation as the world moves away from the data a model was trained on.</description></item><item><title>Prompt Injection</title><link>https://coursiv.io/blog/glossary/prompt-injection</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/prompt-injection</guid><description>Hiding instructions in content the model reads, so a third party effectively takes over the prompt.</description></item><item><title>Red Teaming</title><link>https://coursiv.io/blog/glossary/red-teaming</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/red-teaming</guid><description>Deliberately attacking your own AI system to find failures before someone else does.</description></item><item><title>Responsible AI</title><link>https://coursiv.io/blog/glossary/responsible-ai</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/responsible-ai</guid><description>The practice of building and deploying AI with its effects on people deliberately considered.</description></item><item><title>Robustness</title><link>https://coursiv.io/blog/glossary/robustness</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/robustness</guid><description>Whether a system keeps performing when inputs are noisy, unusual, or deliberately adversarial.</description></item><item><title>Shadow AI</title><link>https://coursiv.io/blog/glossary/shadow-ai</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/shadow-ai</guid><description>Employees using AI tools that the organisation has not approved and cannot see.</description></item><item><title>Transparency</title><link>https://coursiv.io/blog/glossary/transparency</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/transparency</guid><description>Making it clear what an AI system is, what it was trained on, and when someone is interacting with it.</description></item><item><title>Trustworthy AI</title><link>https://coursiv.io/blog/glossary/trustworthy-ai</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/trustworthy-ai</guid><description>An umbrella for the properties an AI system needs to be relied on: valid, safe, secure, accountable, explainable, fair, privacy-enhanced.</description></item><item><title>Watermarking</title><link>https://coursiv.io/blog/glossary/watermarking</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://coursiv.io/blog/glossary/watermarking</guid><description>Embedding a detectable signal in AI-generated content to mark its origin.</description></item></channel></rss>