Generative AI & LLMs advanced

Attention Mechanism

The operation that lets a model weigh which parts of the input matter most for each part of the output.

L’attenzione calcola, per ogni token, quanto ogni altro token debba influenzarlo. La self-attention lo fa all’interno di una sola sequenza ed è il cuore del transformer. Il suo costo cresce in modo quadratico con la lunghezza della sequenza, ed è esattamente per questo che le finestre di contesto lunghe sono costose e che tanta ricerca punta a questo collo di bottiglia.

In pratica: Leggendo una clausola contrattuale, il modello presta molta attenzione al termine definito tre pagine prima.