Foundations advanced

Learning Rate

How big a step training takes each update — the hyperparameter most likely to ruin a run.

Taxa de aprendizado alta demais e o treinamento passa do ponto e diverge; baixa demais e ele se arrasta ou empaca. A maioria das rodadas reais usa um agendamento, começando maior e decaindo ao longo do tempo. É o exemplo clássico de hiperparâmetro: definido por você, não aprendido pelo modelo.

Na prática: Mesmos dados, mesma arquitetura, taxa de aprendizado 10× alta demais — a perda vai para o infinito.

Where this comes up