Guides durchstöbern

AI Glossary Artikel

162

Reinforcement Learning

Ein Reinforcement-Learning-Agent handelt in einer Umgebung, beobachtet, was passiert, und erhält ein Belohnungssignal. Über viele Episoden lernt er eine Strategie, die die erwartete Belohnung maximiert. RL steckt hinter spielenden Systemen und, in abgewandelter Form, hinter dem Alignment-Schritt moderner Chat-Modelle. In der Praxis: Ein Agent lernt ein Spiel, ohne dass ihm die Regeln erklärt werden — nur an einem Punktestand, der steigt oder fällt.

Retrieval-Augmented Generation

RAG teilt die Aufgabe in zwei: Ein Retrieval-Schritt findet Passagen, die zur Frage passen, dann antwortet das Modell mit diesen Passagen als Kontext. Es ist die Standardlösung für Wissens-Cutoffs, private Daten und Halluzinationen, weil das Modell in Text geerdet ist, den es zitieren kann. Die Retrieval-Qualität setzt die Obergrenze — auch das beste Modell rettet die falschen drei Absätze nicht. In der Praxis: Ein Support-Bot, der deine tatsächliche Rückerstattungsrichtlinie zitiert statt einer plausibel klingenden Erfindung. ...

RLHF (Reinforcement Learning from Human Feedback)

RLHF sammelt menschliche Rankings von Modellausgaben, trainiert damit ein Reward-Modell, das diese Präferenzen vorhersagt, und optimiert das Sprachmodell anschließend dagegen. Dieser Post-Training-Schritt macht den größten Teil des Unterschieds zwischen einem rohen Next-Token-Vorhersager und einem brauchbaren Assistenten aus. Er kodiert außerdem die Präferenzen derjenigen, die gerankt haben — eine reale und zu wenig diskutierte Einschränkung. In der Praxis: Zwei Antworten, ein Mensch wählt die bessere, ein paar hunderttausend Mal wiederholt.

Robustheit

Robustheit ist die Leistung außerhalb des aufgeräumten Testsets: Tippfehler, Randfälle, Distribution Shift, Angriffe. Ein Modell, das auf sauberen Daten genau ist und auf echten Daten zusammenbricht, ist in keinem Sinn genau, der zählt. Robustheit ist eine der Vertrauenswürdigkeits-Eigenschaften im NIST AI RMF und eine Anforderung an Hochrisikosysteme in der EU. In der Praxis: Die Genauigkeit fällt von 94% auf 51%, wenn die Fotos bei schlechtem Licht aufgenommen wurden.

Rollen-Prompting

Rollen-Prompting setzt eine Perspektive — ‘du bist ein Steuerberater und prüfst das auf Risiken’ —, und die verschiebt, was das Modell für relevant hält. Register und Schwerpunkt ändern sich dadurch zuverlässig. Wissen oder Autorität kommen nicht hinzu: Einem Modell zu sagen, es sei Anwalt, macht seine Ausgabe nicht zu Rechtsberatung. In der Praxis: ‘Prüfe das als skeptischer CFO’ bringt andere Einwände hervor als ‘prüfe das’.

Schatten-KI

Schatten-KI ist die KI-Variante von Schatten-IT, und sie ist praktisch überall verbreitet, weil die Tools kostenlos sind und der Produktivitätsgewinn sofort da ist. Die Risiken sind Daten, die den geschützten Bereich verlassen, und ungeprüfte Ausgaben, die in Arbeitsergebnisse einfließen. Tools zu blockieren scheitert zuverlässig; freigegebene Alternativen plus Schulung funktionieren besser. In der Praxis: Kundenverträge, die zum Zusammenfassen in einen kostenlosen Consumer-Chatbot kopiert werden.

Schwache KI

Schwache KI arbeitet innerhalb ihres vorgesehenen Rahmens gut und lässt sich nicht darüber hinaus übertragen. Die Bezeichnung ist eine Abgrenzung zur AGI, keine Abwertung — es sind die spezialisierten Systeme, die heute echten Wert schaffen. Ein Allzweckmodell kann breit wirken und in dem Sinn, auf den es ankommt, trotzdem eng sein: Es handelt, lernt und passt sich nicht über sein Design hinaus an. In der Praxis: Ein Modell, das exzellentes Python schreibt, kann dein Auto nicht fahren, so flüssig es auch klingt. ...

SDK

Ein SDK erspart dir selbstgebaute HTTP-Aufrufe, Retries und Streaming. Es übernimmt Authentifizierung, Typisierung und Fehlerbehandlung in idiomatischem Code. Eines zu nutzen ist fast immer schneller und sicherer, als mit dem rohen Endpunkt zu sprechen. In der Praxis: Drei Zeilen Python statt dreißig Zeilen Request-Klempnerei.

Selbstüberwachtes Lernen

Selbstüberwachtes Lernen erfindet aus ungelabelten Daten eine Vorhersageaufgabe, am bekanntesten ‘sag das nächste Token voraus’. Weil das Label einfach das nächste Wort ist, wird das gesamte Internet zu Trainingsdaten ohne menschliche Annotation. Genau deshalb konnten LLMs so skalieren, wie überwachte Modelle es nie konnten. In der Praxis: Das letzte Wort eines Satzes verdecken, das Modell raten lassen, billionenfach wiederholen.

Speech-to-Text

Modernes Speech-to-Text ist über die meisten Akzente hinweg und auch bei Störgeräuschen genau genug, um unbeaufsichtigt für Entwürfe eingesetzt zu werden. Es trägt Meeting-Notizen, Untertitel und Sprachschnittstellen. Die Genauigkeit sinkt weiterhin bei Fachjargon, sich überlappenden Sprechern und unterrepräsentierten Sprachen. In der Praxis: Ein einstündiges Gespräch, transkribiert und zusammengefasst, bevor du den Raum verlässt.