P
prepair.app
Comenzar entrevista →
EnglishУкраїнськаРусскийDeutsch
🗄️

Senior Data EngineerPreguntas de entrevista Data Engineer

Senior · 5+ años de experiencia

Las entrevistas de data engineering se apoyan fuerte en SQL y en si tus pipelines sobreviven ser corridos dos veces, tarde, o fuera de orden. Espera preguntas de modelado sin una única respuesta correcta. Aquí están las preguntas hechas más a menudo, cada una con una respuesta modelo. Senior: arquitectura, trade-offs, mentoría y toma de decisiones.

Pruébalo — sin cuenta necesaria
Preparando tu pregunta…

Temas para prepararte

SQL avanzado
Modelado de datos y warehousing
ETL vs ELT y orquestación
Spark y procesamiento distribuido
Streaming y Kafka
Calidad de datos

6 preguntas de nivel Senior con respuestas

1

¿Cuál es la diferencia entre partitioning y sharding?

Respuesta

Partitioning divide una tabla dentro de una base de datos así el motor puede saltarse chunks irrelevantes; sharding divide datos entre bases de datos separadas así cada una tiene un subconjunto. Partitioning es una herramienta de performance y mantenimiento, sharding es una herramienta de escala con costo real — las consultas y transacciones cross-shard se vuelven difíciles o imposibles. Recurrir a sharding antes de agotar partitioning e indexado es un error común y costoso.

2

¿Cómo manejas la evolución de schema cuando la fuente cambia?

Respuesta

Eligiendo un formato que lleve schema y soporte evolución — Avro o Parquet con un schema registry — y decidiendo de antemano qué cambios son compatibles: agregar un campo opcional usualmente lo es, quitar o retipar uno no. La zona de staging debería aceptar la nueva forma sin fallar toda la carga, y el modo de fallo para el que diseñar es un ensanchamiento de tipo silencioso que corrompe los agregados downstream.

3

¿Cómo mides y automatizas la calidad de datos?

Respuesta

Contra dimensiones nombradas — completitud, unicidad, validez, oportunidad, consistencia — cada una expresada como una verificación con un umbral en vez de una sensación. Automatización significa que las verificaciones corren como parte del pipeline y pueden detenerlo, porque un reporte de calidad que nadie lee no es control de calidad. La que la gente se salta es la oportunidad, y datos obsoletos que se ven correctos causan más daño que datos que obviamente faltan.

4

Un job que solía tomar veinte minutos ahora toma cuatro horas. ¿Cómo averiguas por qué?

Respuesta

Empieza con qué cambió: volumen de datos, skew, tamaño del cluster, o el código. Luego mira la vista de stages — un stage tomando la mayoría del tiempo usualmente significa un shuffle, y unas pocas tareas tomando mucho más tiempo que el resto significa skew. Skew es la respuesta más a menudo de lo que la gente espera, y los arreglos son salar la clave, hacer broadcast del lado pequeño, o repartitioning.

5

¿Qué es la arquitectura medallion y qué problema resuelve?

Respuesta

Bronze tiene los datos crudos ingestados, silver tiene datos limpios y conformados, gold tiene agregados a nivel de negocio. El problema que resuelve es que las transformaciones se enredan cuando todos leen de donde sea conveniente — con capas, el linaje es legible y una carga mala puede reprocesarse desde bronze sin reingestar desde la fuente. Es una convención más que una tecnología, y su valor está enteramente en que se cumpla.

6

¿Cuándo aceptas consistencia eventual en una plataforma de datos?

Respuesta

Casi siempre para analytics, porque un dashboard que está un minuto atrasado no cambia nada, y el costo de consistencia fuerte a través de un store distribuido es la disponibilidad durante una partición. No la aceptas donde una decisión downstream es financiera o regulatoria, o donde dos sistemas deben coincidir en un número en el mismo instante. La parte importante es que la elección se declare, ya que el modo de fallo es descubrirla durante una auditoría.

🦎

Leer respuestas no es suficiente

En una entrevista real hablas bajo presión. Cam hace estas mismas preguntas, evalúa cada respuesta y muestra exactamente qué mejorar.

Practicar entrevista de Senior Data Engineer →
Gratis · 3 entrevistas al mes

Otros niveles — Data Engineer

Junior Data EngineerMiddle Data EngineerTodas las preguntas de Data Engineer

Otras especializaciones

🔍Senior Manual QA🤖Senior QA AutomationSenior Java Backend🐍Senior Python Backend🐘Senior PHP Backend🦫Senior Go Backend🟢Senior Node.js Backend💎Senior Ruby on Rails🔷Senior C++🟨Senior JavaScript