Mixture of Experts
Also called: MoE
An architecture where only a fraction of the model's parameters activate for any given token.
Un modèle à mélange d’experts contient de nombreux sous-réseaux spécialisés et un routeur qui en choisit quelques-uns par token. Le nombre total de paramètres reste énorme tandis que le calcul par token reste modeste, ce qui découple la capacité du coût d’inférence. C’est pourquoi certains très grands modèles sont étonnamment peu coûteux à servir.
En pratique : Un modèle de 400 milliards de paramètres qui ne fait tourner que l’équivalent de 40 milliards de paramètres de calcul par token.