Was verursacht verschwindende und explodierende Gradienten, und wie geht man damit um?
In einem tiefen Netz werden Gradienten während der Backpropagation über viele Schichten hinweg miteinander multipliziert; sind diese Faktoren durchgehend kleiner als 1, schrumpft der Gradient bis zu den frühen Schichten gegen null, sind sie größer als 1, explodiert er. ReLU-Aktivierungen, sorgfältige Gewichtsinitialisierung (Xavier, He), Batch- oder Layer-Normalisierung und Residual-Verbindungen adressieren das alle — teilweise deshalb lassen sich ResNets und Transformer so viel tiefer trainieren als einfache Feedforward-Netze.