Generative AI & LLMs advanced

Attention Mechanism

The operation that lets a model weigh which parts of the input matter most for each part of the output.

Attention berechnet für jeden Token, wie stark jeder andere Token ihn beeinflussen soll. Self-Attention tut das innerhalb einer Sequenz und ist der Kern des Transformers. Der Aufwand wächst quadratisch mit der Sequenzlänge — genau deshalb sind große Kontextfenster teuer, und genau deshalb zielt so viel Forschung auf diesen Engpass.

In der Praxis: Beim Lesen einer Vertragsklausel achtet das Modell stark auf den Begriff, der drei Seiten früher definiert wurde.