Transformer
The neural network architecture behind essentially every modern language model, built around attention.
Introduit en 2017, le transformer a remplacé le traitement séquentiel par l’attention, ce qui permet au modèle de regarder tous les tokens de l’entrée d’un coup et de pondérer leur pertinence les uns par rapport aux autres. C’est ce parallélisme qui a rendu praticable l’entraînement sur du texte à l’échelle d’internet. Le ‘T’ de GPT signifie transformer.
En pratique : Dans ’le trophée n’entrait pas dans la vitrine parce qu’il était trop grand’, l’attention est ce qui permet au modèle de relier ‘il’ à ’trophée’.
Where this comes up
- Claude Opus 4.7: The Most Powerful Opus Model Yet by Anthropic
- DeepSeek vs ChatGPT in 2026: Coding, Pricing, Privacy & Best Use Cases
- How Does ChatGPT Work? A Deep Dive into AI Language Models
- Sakana AI Fugu Review: Fugu Ultra vs Claude Fable 5
- The Best YouTube Channels to Learn AI: A Comprehensive Guide
- What Is Generative AI in Simple Terms?