Beschreibe, wie du Features für ein Churn-Modell auswählen und Leakage vermeiden würdest.
Beginne mit dem, was zum Vorhersagezeitpunkt tatsächlich bekannt ist — ein Feature, das aus Daten berechnet wird, die erst nach dem Ergebnis existieren (etwa „Tage seit Öffnen der Kündigungs-E-Mail", falls diese E-Mail erst verschickt wird, nachdem sich jemand bereits zum Abwandern entschieden hat), schleust das Label direkt in den Input ein und liefert ein Modell, das offline großartig aussieht und in Produktion versagt. Nach dem Ausschluss von Leakage grenzt du die Liste mit Domänenwissen, der Korrelation zum Ziel und etwas wie Permutation Importance ein, und prüfst dann Multikollinearität unter den verbliebenen Kandidaten, statt einem einzelnen Importance-Wert isoliert zu vertrauen.