P
prepair.app
Comenzar entrevista →
EnglishУкраїнськаРусскийDeutsch
📊

Junior Data ScientistPreguntas de entrevista data scientist

Junior · sin experiencia / menos de 1 año

Las entrevistas de data science evalúan tres cosas a la vez: si realmente entiendes estadística en lugar de recitar definiciones, si puedes extraer y moldear datos tú mismo con SQL y pandas, y si puedes convertir un modelo en una decisión sobre la que alguien realmente actuará. Aquí están las preguntas más frecuentes, cada una con una respuesta modelo. Junior: teoría básica, definiciones y casos prácticos simples.

Pruébalo — sin cuenta necesaria
Preparando tu pregunta…

Temas para prepararte

Fundamentos de estadística y probabilidad
Pruebas de hipótesis, p-values, intervalos de confianza
SQL y manipulación de datos con pandas
Regresión, clasificación, feature engineering
A/B testing y diseño de experimentos
Inferencia causal y comunicación de resultados

6 preguntas de nivel Junior con respuestas

1

¿Cuál es la diferencia entre estadística poblacional y muestral, y por qué cambia tus fórmulas?

Respuesta

Una estadística poblacional describe a todos los que te interesan; una estadística muestral la estima a partir de un subconjunto, y esa estimación agrega incertidumbre que un parámetro poblacional no tiene. Se ve concretamente en la varianza: dividir entre n-1 en lugar de n para la varianza muestral (corrección de Bessel) corrige un sesgo que de otro modo subestimaría sistemáticamente la verdadera varianza poblacional.

2

¿Cuál es la diferencia entre correlación y causalidad, en términos simples?

Respuesta

Correlación significa que dos variables se mueven juntas; causalidad significa que una produce un cambio en la otra. Las ventas de helado y las muertes por ahogamiento correlacionan porque ambas suben con el calor del verano — ninguna causa la otra. Tratar una correlación como causal sin una comparación controlada o un mecanismo plausible es el error analítico más común entre analistas junior.

3

¿Cómo unirías dos tablas en SQL, y cuál es la diferencia entre INNER y LEFT JOIN?

Respuesta

INNER JOIN conserva solo las filas que coinciden en la clave de unión en ambas tablas; LEFT JOIN conserva cada fila de la tabla izquierda y rellena con NULL donde no hay coincidencia a la derecha. Elegir INNER JOIN por defecto cuando en realidad quieres LEFT JOIN descarta filas en silencio — los clientes sin pedidos desaparecen por completo en lugar de aparecer con un cero, lo que sesga silenciosamente cualquier agregado construido encima.

4

¿Qué te dice una distribución normal, y qué rompe ese supuesto en datos reales?

Respuesta

Una distribución normal es simétrica alrededor de su media, con cerca del 68% de los valores dentro de una desviación estándar y 95% dentro de dos — sustenta la mayoría de las pruebas estadísticas clásicas. Los datos de negocio reales a menudo no son normales: la revenue y la duración de sesión están sesgadas a la derecha con una cola larga, y los conteos de eventos raros siguen más bien una forma de Poisson, por eso revisas la distribución antes de asumir que un t-test es válido.

5

¿Cuál es la diferencia entre `.loc` y `.iloc` en pandas?

Respuesta

.loc selecciona por etiqueta — el índice real o el nombre de columna —, mientras que .iloc selecciona por posición entera sin importar cuáles sean las etiquetas. Divergen dolorosamente después de filtrar u ordenar un DataFrame, porque el orden posicional ya no coincide con el índice original; usar .iloc[0] ahí te da la primera fila de la vista actual, no "índice 0".

6

¿Qué es el p-hacking, y cómo evitas hacerlo por accidente?

Respuesta

El p-hacking es correr muchos análisis — distintas métricas, distintos cortes de datos, distintas ventanas de tiempo — hasta que uno cruza p < 0.05, y luego reportar solo ese como si fuera la única prueba planeada. Sucede por accidente cuando revisas un dashboard a diario y te detienes en el momento en que una métrica parece significativa. La solución es preregistrar qué medirás y cuándo lo mirarás antes de que lleguen los datos, no después.

🦎

Leer respuestas no es suficiente

En una entrevista real hablas bajo presión. Cam hace estas mismas preguntas, evalúa cada respuesta y muestra exactamente qué mejorar.

Practicar entrevista de Junior Data Scientist →
Gratis · 3 entrevistas al mes

Otros niveles — Data Scientist

Middle Data ScientistSenior Data ScientistTodas las preguntas de Data Scientist

Otras especializaciones

🔍Junior Manual QA🤖Junior QA AutomationJunior Java Backend🐍Junior Python Backend🐘Junior PHP Backend🦫Junior Go Backend🟢Junior Node.js Backend💎Junior Ruby on Rails🟣Junior .NET Backend Developer🔷Junior C++