O que causa gradientes que desaparecem e explodem, e como lidar com isso?
Numa rede profunda, os gradientes são multiplicados entre si ao longo de várias camadas durante o backpropagation, então se esses fatores forem consistentemente menores que 1 o gradiente encolhe até quase zero ao chegar nas primeiras camadas, e se forem maiores que 1 ele explode. Ativações da família ReLU, inicialização cuidadosa dos pesos (Xavier, He), normalização batch ou layer, e conexões residuais tratam disso — em parte por isso ResNets e transformers podem ser treinados muito mais profundos que redes feedforward simples.