Learning Rate
How big a step training takes each update — the hyperparameter most likely to ruin a run.
Taxa de aprendizado alta demais e o treinamento passa do ponto e diverge; baixa demais e ele se arrasta ou empaca. A maioria das rodadas reais usa um agendamento, começando maior e decaindo ao longo do tempo. É o exemplo clássico de hiperparâmetro: definido por você, não aprendido pelo modelo.
Na prática: Mesmos dados, mesma arquitetura, taxa de aprendizado 10× alta demais — a perda vai para o infinito.