P
prepair.app
Comenzar entrevista →
EnglishУкраїнськаРусскийDeutsch
📊

Preguntas de entrevista data scientist

Las entrevistas de data science evalúan tres cosas a la vez: si realmente entiendes estadística en lugar de recitar definiciones, si puedes extraer y moldear datos tú mismo con SQL y pandas, y si puedes convertir un modelo en una decisión sobre la que alguien realmente actuará. Aquí están las preguntas más frecuentes, cada una con una respuesta modelo.

Junior · sin experiencia / menos de 1 añoMiddle · 2–4 años de experienciaSenior · 5+ años de experiencia

Qué preguntan

Fundamentos de estadística y probabilidad
Pruebas de hipótesis, p-values, intervalos de confianza
SQL y manipulación de datos con pandas
Regresión, clasificación, feature engineering
A/B testing y diseño de experimentos
Inferencia causal y comunicación de resultados

9 preguntas reales con respuestas

Cada pregunta viene con una respuesta modelo con la que puedes comparar la tuya.

1

¿Cuándo reportarías la mediana en lugar de la media?

Respuesta

Cuando la distribución está sesgada o tiene outliers que la media no puede resistir — ingresos, latencia, tiempo hasta la compra. Un salario de ejecutivo o una solicitud de 30 segundos arrastra la media hacia un punto donde ningún dato típico realmente se ubica, mientras que la mediana se queda donde está la mayoría de los datos. En la práctica reportas ambas más un percentil como p95, porque la brecha entre media y mediana es en sí misma informativa sobre el sesgo.

2

¿Qué significa realmente un p-value, y cuál es su malentendido más común?

Respuesta

Un p-value es la probabilidad de observar datos tan extremos (o más) si la hipótesis nula fuera cierta — no es la probabilidad de que la hipótesis nula sea cierta, ni la probabilidad de que tu resultado se deba al azar. El malentendido común trata p < 0.05 como "95% de confianza en que el efecto es real", lo cual confunde una afirmación sobre los datos dado la hipótesis con una afirmación sobre la hipótesis dado los datos. Esa confusión es exactamente lo que impulsa el p-hacking: corre suficientes pruebas y una cruzará 0.05 solo por azar.

3

¿Qué te dice realmente un intervalo de confianza del 95%?

Respuesta

Si repitieras el proceso de muestreo muchas veces y construyeras un intervalo de la misma manera cada vez, el 95% de esos intervalos contendrían el parámetro verdadero — es una afirmación sobre el procedimiento, no una probabilidad del 95% de que este intervalo en particular contenga el valor verdadero. Un intervalo ancho es información honesta: normalmente significa que la muestra es demasiado pequeña para afirmar mucho, y una estimación puntual sin él es un número que aparenta más certeza de la que los datos respaldan.

4

¿Cuándo recurres a una window function en lugar de GROUP BY en SQL?

Respuesta

GROUP BY colapsa filas en una por grupo, así que pierdes el detalle a nivel de fila. Una window function como ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY created_at) calcula un valor sobre una partición pero conserva cada fila — eso es lo que necesitas para "el último pedido por cliente", totales acumulados o el rango dentro de un grupo. Recurrir a un self-join o a una subconsulta cuando una window function bastaría es la señal clásica de alguien que aprendió SQL antes de que las window functions fueran comunes.

5

¿Cómo decides entre un enfoque de regresión y uno de clasificación para la misma pregunta de negocio?

Respuesta

Depende de qué es realmente el target y cómo se usará el output, no de qué modelo rinde mejor de forma aislada. "¿Este usuario abandonará en 30 días?" es naturalmente una clasificación con un umbral que ajustas al costo de negocio de los falsos positivos frente a los falsos negativos; "cuánta revenue generará esta cuenta" es una regresión, y convertirla en buckets descarta información que el negocio suele necesitar. A veces la respuesta honesta es modelar el target continuo y derivar la clasificación después, lo que evita fijar un umbral arbitrario dentro del propio modelo.

6

Explica el trade-off entre bias y varianza con un ejemplo concreto.

Respuesta

Un modelo con bias alto — digamos una regresión lineal sobre datos con curvatura real — subajusta: se equivoca de forma consistente en la misma dirección tanto en train como en test. Un modelo con varianza alta — un árbol de decisión profundo y sin podar — sobreajusta: memoriza el ruido del entrenamiento y su rendimiento oscila mucho entre train y test. La regularización, la cross-validation y conjuntos de features más simples intercambian algo de bias por una reducción real de la varianza, y el objetivo es el punto donde se minimiza el error en test, no en train.

7

¿Cómo determinas el tamaño de muestra antes de correr un A/B test?

Respuesta

Necesitas cuatro inputs: la tasa de conversión base, el efecto mínimo detectable que vale la pena notar, la potencia estadística (usualmente 80%) y el nivel de significancia (usualmente 0.05). Efectos más pequeños y mayor potencia requerida exigen ambos más tráfico, por lo que los equipos que se saltan este paso terminan corriendo tests infrapotenciados que no pueden detectar un efecto real, o corriendo tests de meses para un cambio demasiado pequeño para importar. Un cálculo de potencia antes de lanzar convierte "el test no mostró diferencia" en una respuesta real en lugar de un encogimiento de hombros.

8

¿Cuáles son las formas más comunes en que un A/B test te da una respuesta equivocada aunque la estadística esté bien hecha?

Respuesta

Espiar los resultados y detener el test en cuanto parece significativo infla la tasa de falsos positivos muy por encima del 5%, porque en realidad estás corriendo muchos tests implícitos a lo largo del tiempo. El sample ratio mismatch — cuando la división real se desvía del 50/50 previsto — suele señalar un bug en la lógica de asignación e invalida el resultado antes de que siquiera mires la métrica. Los efectos de novedad inflan mejoras de corto plazo que luego se desvanecen, y los efectos de red entre el grupo de test y el de control (dos usuarios del mismo grafo social, uno en cada brazo) violan la independencia que las estadísticas del test asumen.

9

¿Por qué correlación no implica causalidad, y a qué herramientas recurres cuando no puedes correr un experimento?

Respuesta

Dos variables pueden moverse juntas porque una causa la otra, porque una tercera variable causa ambas (un confounder), o por pura coincidencia en un dataset lo bastante grande. Cuando la aleatorización no es posible, recurres a diseños cuasiexperimentales: difference-in-differences, regression discontinuity alrededor de un umbral, variables instrumentales, o propensity score matching para aproximar una comparación aleatorizada a partir de datos observacionales. Cada uno de ellos descansa en un supuesto que no puedes verificar del todo, así que el entregable honesto es la estimación más una declaración clara de qué la invalidaría.

🦎

Leer respuestas no es suficiente

En una entrevista real hablas bajo presión. Cam hace estas mismas preguntas, evalúa cada respuesta y muestra exactamente qué mejorar.

Practicar entrevista de Data Scientist →
Gratis · 3 entrevistas al mes

Vale la pena leer

Todos los artículos →

Otras especializaciones

🔍Manual QA🤖QA AutomationJava Backend🐍Python Backend🐘PHP Backend🦫Go Backend🟢Node.js Backend💎Ruby on Rails🟣.NET Backend Developer🔷C++🟨JavaScript⚛️React Frontend💚Vue Frontend🅰️Angular FrontendNext.js🍏iOS (Swift)🟩Android (Kotlin)📱React Native Developer⚙️DevOps / SRE🗄️Data Engineer🧠AI/ML Engineer📈Business Analyst🎯Product Manager📋Project Manager🎨UI/UX Designer📣Marketing🧑‍💼HR / Recruiter🤝Sales / Account Manager🎧Technical Support Engineer