Generative AI & LLMs advanced

Attention Mechanism

The operation that lets a model weigh which parts of the input matter most for each part of the output.

La atención calcula, para cada token, cuánto debe influir en él cada uno de los demás tokens. La autoatención hace esto dentro de una misma secuencia y es el núcleo del transformer. Su costo crece de forma cuadrática con la longitud de la secuencia, que es exactamente la razón por la que las ventanas de contexto largas son caras y por la que tanta investigación apunta a ese cuello de botella.

En la práctica: Al leer una cláusula de un contrato, el modelo atiende con fuerza al término definido tres páginas antes.