¿Qué causa los gradientes que desaparecen y explotan, y cómo se manejan?
En una red profunda, los gradientes se multiplican entre sí a través de muchas capas durante el backpropagation, así que si esos factores son consistentemente menores a 1 el gradiente se encoge hacia cero al llegar a las primeras capas, y si son mayores a 1 explota. Las activaciones tipo ReLU, una inicialización de pesos cuidadosa (Xavier, He), la normalización batch o layer, y las conexiones residuales abordan esto — en parte por eso ResNets y transformers se pueden entrenar mucho más profundos que las redes feedforward simples.