Что вызывает затухающие и взрывающиеся градиенты и как с этим справляться?
В глубокой сети градиенты перемножаются через много слоёв во время backpropagation, и если эти множители стабильно меньше 1, градиент к ранним слоям стремится к нулю, а если больше 1 — взрывается. С этим справляются активациями семейства ReLU, аккуратной инициализацией весов (Xavier, He), batch- или layer-нормализацией и residual-связями — отчасти поэтому ResNet и трансформеры можно обучать намного глубже обычных feedforward-сетей.