Generative AI & LLMs advanced

Distillation

Training a small model to imitate a large one, keeping most of the quality at a fraction of the cost.

Dans la distillation, un grand modèle enseignant produit des sorties qui servent à entraîner un modèle élève plus petit. L’élève finit moins cher et plus rapide tout en conservant une bonne part du comportement de l’enseignant sur la distribution visée. La plupart des modèles de production abordables sont distillés à partir de plus gros.

En pratique : Un modèle 10× plus petit et 20× moins cher qui traite 90% de votre trafic tout aussi bien.