Transformer
The neural network architecture behind essentially every modern language model, built around attention.
Presentado en 2017, el transformer reemplazó el procesamiento secuencial por la atención, lo que le permite al modelo mirar todos los tokens de la entrada a la vez y ponderar qué tan relevantes son entre sí. Ese paralelismo es lo que volvió práctico entrenar con texto a escala de internet. La ‘T’ de GPT viene de transformer.
En la práctica: En ’el trofeo no cabía en la vitrina porque era demasiado grande’, la atención es la forma en que el modelo conecta ’era’ con ’trofeo’.
Where this comes up
- Claude Opus 4.7: The Most Powerful Opus Model Yet by Anthropic
- DeepSeek vs ChatGPT in 2026: Coding, Pricing, Privacy & Best Use Cases
- How Does ChatGPT Work? A Deep Dive into AI Language Models
- Sakana AI Fugu Review: Fugu Ultra vs Claude Fable 5
- The Best YouTube Channels to Learn AI: A Comprehensive Guide
- What Is Generative AI in Simple Terms?