Generative AI & LLMs advanced

Mixture of Experts

Also called: MoE

An architecture where only a fraction of the model's parameters activate for any given token.

Um modelo mixture-of-experts contém muitas sub-redes especializadas e um roteador que escolhe algumas delas por token. A contagem total de parâmetros continua enorme enquanto a computação por token continua modesta, o que desacopla capacidade de custo de inferência. É por isso que alguns modelos muito grandes são surpreendentemente baratos de servir.

Na prática: Um modelo de 400B de parâmetros que só roda o equivalente a 40B de computação por token.