Mixture of Experts
Also called: MoE
An architecture where only a fraction of the model's parameters activate for any given token.
Un modelo de mezcla de expertos contiene muchas subredes especializadas y un enrutador que elige unas pocas por token. El conteo total de parámetros sigue siendo enorme mientras el cómputo por token se mantiene modesto, lo que desacopla la capacidad del costo de inferencia. Por eso algunos modelos muy grandes resultan sorprendentemente baratos de servir.
En la práctica: Un modelo de 400B parámetros que solo ejecuta el cómputo equivalente a 40B por token.