Generative AI & LLMs advanced

Mixture of Experts

Also called: MoE

An architecture where only a fraction of the model's parameters activate for any given token.

Un modèle à mélange d’experts contient de nombreux sous-réseaux spécialisés et un routeur qui en choisit quelques-uns par token. Le nombre total de paramètres reste énorme tandis que le calcul par token reste modeste, ce qui découple la capacité du coût d’inférence. C’est pourquoi certains très grands modèles sont étonnamment peu coûteux à servir.

En pratique : Un modèle de 400 milliards de paramètres qui ne fait tourner que l’équivalent de 40 milliards de paramètres de calcul par token.