Transformer
The neural network architecture behind essentially every modern language model, built around attention.
2017 vorgestellt, ersetzte der Transformer die sequenzielle Verarbeitung durch Attention: Das Modell kann jedes Token der Eingabe auf einmal ansehen und deren Relevanz füreinander gewichten. Diese Parallelität machte das Training auf internetgroßen Textmengen praktikabel. Das ‘T’ in GPT steht für Transformer.
In der Praxis: In ‘die Trophäe passte nicht in den Koffer, weil sie zu groß war’ ist Attention der Mechanismus, über den das Modell ‘sie’ mit ‘Trophäe’ verbindet.
Where this comes up
- Claude Opus 4.7: The Most Powerful Opus Model Yet by Anthropic
- DeepSeek vs ChatGPT in 2026: Coding, Pricing, Privacy & Best Use Cases
- How Does ChatGPT Work? A Deep Dive into AI Language Models
- Sakana AI Fugu Review: Fugu Ultra vs Claude Fable 5
- The Best YouTube Channels to Learn AI: A Comprehensive Guide
- What Is Generative AI in Simple Terms?