Mixture of Experts
Also called: MoE
An architecture where only a fraction of the model's parameters activate for any given token.
Um modelo mixture-of-experts contém muitas sub-redes especializadas e um roteador que escolhe algumas delas por token. A contagem total de parâmetros continua enorme enquanto a computação por token continua modesta, o que desacopla capacidade de custo de inferência. É por isso que alguns modelos muito grandes são surpreendentemente baratos de servir.
Na prática: Um modelo de 400B de parâmetros que só roda o equivalente a 40B de computação por token.