Explica cómo elegirías features para un modelo de churn y evitarías el leakage.
Empieza por lo que es conocible en el momento de la predicción — un feature calculado a partir de datos que solo existen después del resultado (como "días desde que se abrió el email de cancelación", si ese email solo se envía después de que alguien ya decidió irse) filtra el label directamente al input y te da un modelo que se ve genial offline y falla en producción. Después de descartar el leakage, reduces la lista con conocimiento de dominio, correlación con el target, y algo como permutation importance, y luego revisas multicolinealidad entre los sobrevivientes en lugar de confiar en un solo score de importancia aislado.