Generative AI & LLMs intermediate

Transformer

The neural network architecture behind essentially every modern language model, built around attention.

Apresentado em 2017, o transformer substituiu o processamento sequencial pela atenção, deixando o modelo olhar para todos os tokens da entrada de uma vez e pesar a relevância de uns para os outros. É esse paralelismo que tornou prático treinar com texto em escala de internet. O ‘T’ de GPT vem de transformer.

Na prática: Em ‘o troféu não coube na caixa porque ele era grande demais’, a atenção é como o modelo conecta ’ele’ a ’troféu’.

Where this comes up