Generative AI & LLMs advanced

Mixture of Experts

Also called: MoE

An architecture where only a fraction of the model's parameters activate for any given token.

Un modello mixture-of-experts contiene molte sotto-reti specializzate e un router che ne sceglie alcune per ogni token. Il numero totale di parametri resta enorme mentre il calcolo per token resta contenuto, il che disaccoppia la capacità dal costo di inferenza. È per questo che alcuni modelli molto grandi sono sorprendentemente economici da servire.

In pratica: Un modello da 400B parametri che per ogni token esegue calcolo pari solo a 40B.