Learning Rate
How big a step training takes each update — the hyperparameter most likely to ruin a run.
Un taux d’apprentissage trop élevé et l’entraînement dépasse la cible puis diverge ; trop faible et il rampe ou reste coincé. La plupart des runs réels le programment, en partant plus grand puis en le faisant décroître au fil du temps. C’est l’exemple classique de l’hyperparamètre : fixé par vous, pas appris par le modèle.
En pratique : Mêmes données, même architecture, taux d’apprentissage 10× trop élevé — la perte part à l’infini.