Generative AI & LLMs advanced

Attention Mechanism

The operation that lets a model weigh which parts of the input matter most for each part of the output.

A atenção calcula, para cada token, quanto cada um dos outros tokens deve influenciá-lo. A self-attention faz isso dentro de uma mesma sequência e é o núcleo do transformer. Seu custo cresce de forma quadrática com o comprimento da sequência, que é exatamente por que janelas de contexto longas são caras e por que tanta pesquisa mira nesse gargalo.

Na prática: Ao ler uma cláusula de contrato, o modelo presta muita atenção ao termo definido três páginas antes.