Mécanisme d'attention
L’attention calcule, pour chaque token, dans quelle mesure chacun des autres tokens doit l’influencer. L’auto-attention le fait à l’intérieur d’une même séquence et constitue le cœur du transformer. Son coût croît de façon quadratique avec la longueur de la séquence, ce qui explique précisément pourquoi les grandes fenêtres de contexte coûtent cher et pourquoi tant de travaux de recherche visent ce goulot d’étranglement. En pratique : En lisant une clause de contrat, le modèle porte une forte attention au terme défini trois pages plus haut. ...