Foundations advanced

Learning Rate

How big a step training takes each update — the hyperparameter most likely to ruin a run.

Un learning rate troppo alto e l’addestramento supera il bersaglio e diverge; troppo basso e procede a passo di lumaca o si blocca. Nella maggior parte delle sessioni reali lo si programma, partendo più alti e facendolo decadere nel tempo. È l’esempio classico di iperparametro: lo imposti tu, non lo impara il modello.

In pratica: Stessi dati, stessa architettura, learning rate 10× troppo alto — la loss va a infinito.

Where this comes up