Foundations advanced

Learning Rate

How big a step training takes each update — the hyperparameter most likely to ruin a run.

Con una tasa de aprendizaje demasiado alta, el entrenamiento se pasa de largo y diverge; con una demasiado baja, avanza a rastras o se atasca. La mayoría de las corridas reales la programan: empiezan más alta y la van decayendo con el tiempo. Es el ejemplo clásico de hiperparámetro: lo fijas tú, no lo aprende el modelo.

En la práctica: Mismos datos, misma arquitectura, tasa de aprendizaje 10× demasiado alta — la pérdida se va al infinito.

Where this comes up