P
prepair.app
Comenzar entrevista →
EnglishУкраїнськаРусскийDeutsch
🗄️

Junior Data EngineerPreguntas de entrevista Data Engineer

Junior · sin experiencia / menos de 1 año

Las entrevistas de data engineering se apoyan fuerte en SQL y en si tus pipelines sobreviven ser corridos dos veces, tarde, o fuera de orden. Espera preguntas de modelado sin una única respuesta correcta. Aquí están las preguntas hechas más a menudo, cada una con una respuesta modelo. Junior: teoría básica, definiciones y casos prácticos simples.

Pruébalo — sin cuenta necesaria
Preparando tu pregunta…

Temas para prepararte

SQL avanzado
Modelado de datos y warehousing
ETL vs ELT y orquestación
Spark y procesamiento distribuido
Streaming y Kafka
Calidad de datos

7 preguntas de nivel Junior con respuestas

1

¿Cuál es la diferencia entre datos estructurados, semi-estructurados y no estructurados?

Respuesta

Los datos estructurados tienen un schema fijo y viven en filas y columnas — una tabla de base de datos, un CSV. Los semi-estructurados llevan su schema consigo y varían fila a fila — JSON, XML, Avro. Los no estructurados no tienen schema en absoluto: texto, imágenes, audio. La distinción decide dónde se puede almacenar y cómo se consulta, por eso un pipeline usualmente convierte input semi-estructurado en algo columnar antes de que alguien lo analice.

2

¿Cuál es la diferencia entre GROUP BY y PARTITION BY?

Respuesta

GROUP BY colapsa filas — obtienes una fila por grupo y pierdes el detalle. PARTITION BY, usado con una window function, mantiene cada fila y calcula el agregado junto a ella. Así que si quieres cada orden más el total del cliente, PARTITION BY te da ambos en una pasada; GROUP BY fuerza un join de vuelta al detalle.

3

¿Qué es una window function y en qué se diferencia de un agregado?

Respuesta

Un agregado devuelve un valor por grupo; una window function devuelve un valor por cada fila, calculado sobre una ventana de filas relacionadas. ROW_NUMBER, RANK, LAG y un SUM acumulado son las comunes. ROW_NUMBER() OVER (PARTITION BY customer_id ORDER BY created_at DESC) numera las órdenes de cada cliente de más nueva a más vieja, que es cómo tomas la última fila por grupo sin un self-join.

4

¿Cuál es la diferencia entre WHERE y HAVING?

Respuesta

WHERE filtra filas antes de agrupar, HAVING filtra grupos después. Así que una condición sobre una columna cruda pertenece a WHERE y una condición sobre un agregado pertenece a HAVING. Poner un filtro de columna plano en HAVING igual funciona pero hace que el motor agrupe filas que luego va a descartar, lo que en una tabla grande es un costo real.

5

¿Qué es un índice, y cuándo no ayuda?

Respuesta

Una estructura separada que deja al motor encontrar filas sin escanear la tabla. No ayuda cuando la consulta devuelve la mayoría de la tabla, porque un escaneo secuencial es más barato que saltar a través del índice; no ayuda si el filtro de la consulta no coincide con las columnas líderes de un índice compuesto; y cuesta en cada escritura, ya que el índice debe mantenerse.

6

¿Cuál es la diferencia entre un Data Lake y un Data Warehouse?

Respuesta

Un lake almacena datos crudos en su forma original y aplica schema al leer; un warehouse almacena datos modelados y limpios con un schema aplicado al escribir. El lake es más barato y guarda todo, incluyendo cosas que nadie ha decidido cómo usar. El warehouse es lo que consultan los analistas. La mayoría de las empresas tienen ambos, con el warehouse alimentado desde el lake.

7

¿Cuál es la diferencia entre una tabla de hechos y una tabla de dimensión?

Respuesta

Una tabla de hechos guarda los eventos medibles — una venta, un click — con medidas numéricas y foreign keys. Las tablas de dimensión guardan el contexto descriptivo al que apuntan esas claves: cliente, producto, fecha. Los hechos crecen constantemente y son angostos; las dimensiones son anchas y cambian lentamente. Confundir esto es el error de modelado más común, y se ve como consultas que nadie puede escribir.

🦎

Leer respuestas no es suficiente

En una entrevista real hablas bajo presión. Cam hace estas mismas preguntas, evalúa cada respuesta y muestra exactamente qué mejorar.

Practicar entrevista de Junior Data Engineer →
Gratis · 3 entrevistas al mes

Otros niveles — Data Engineer

Middle Data EngineerSenior Data EngineerTodas las preguntas de Data Engineer

Otras especializaciones

🔍Junior Manual QA🤖Junior QA AutomationJunior Java Backend🐍Junior Python Backend🐘Junior PHP Backend🦫Junior Go Backend🟢Junior Node.js Backend💎Junior Ruby on Rails🔷Junior C++🟨Junior JavaScript