Attention Mechanism
The operation that lets a model weigh which parts of the input matter most for each part of the output.
A atenção calcula, para cada token, quanto cada um dos outros tokens deve influenciá-lo. A self-attention faz isso dentro de uma mesma sequência e é o núcleo do transformer. Seu custo cresce de forma quadrática com o comprimento da sequência, que é exatamente por que janelas de contexto longas são caras e por que tanta pesquisa mira nesse gargalo.
Na prática: Ao ler uma cláusula de contrato, o modelo presta muita atenção ao termo definido três páginas antes.