Що спричиняє згасаючі й вибухові градієнти і як з цим боротися?
У глибокій мережі градієнти перемножуються через багато шарів під час backpropagation, і якщо ці множники стабільно менші за 1, градієнт до ранніх шарів прямує до нуля, а якщо більші за 1 — вибухає. З цим справляються активаціями родини ReLU, акуратною ініціалізацією ваг (Xavier, He), batch- чи layer-нормалізацією та residual-звʼязками — почасти тому ResNet і трансформери можна навчати набагато глибше за звичайні feedforward-мережі.