Learning Rate
How big a step training takes each update — the hyperparameter most likely to ruin a run.
Ist die Lernrate zu hoch, schießt das Training über das Ziel hinaus und divergiert; ist sie zu niedrig, kriecht es oder bleibt stecken. Die meisten echten Läufe planen sie über einen Schedule, starten größer und lassen sie mit der Zeit abklingen. Sie ist das klassische Beispiel für einen Hyperparameter: von dir gesetzt, nicht vom Modell gelernt.
In der Praxis: Gleiche Daten, gleiche Architektur, Lernrate 10× zu hoch — der Loss geht ins Unendliche.