Mixture of Experts
Also called: MoE
An architecture where only a fraction of the model's parameters activate for any given token.
Ein Mixture-of-Experts-Modell enthält viele spezialisierte Teilnetze und einen Router, der pro Token einige davon auswählt. Die Gesamtzahl der Parameter bleibt riesig, während die Rechenlast pro Token bescheiden bleibt, und das entkoppelt Kapazität von den Inferenzkosten. Deshalb lassen sich manche sehr großen Modelle überraschend günstig betreiben.
In der Praxis: Ein Modell mit 400B Parametern, das pro Token nur die Rechenlast von 40B ausführt.