P
prepair.app
Interview starten →
EnglishУкраїнськаРусскийDeutsch
🗄️

Senior Data EngineerData-Engineer-Interviewfragen

Senior · 5+ Jahre Erfahrung

Interviews für Data Engineers drehen sich stark um SQL und darum, ob deine Pipelines es überleben, zweimal, verspätet oder in falscher Reihenfolge zu laufen. Rechne außerdem mit Modellierungsfragen, auf die es keine einzig richtige Antwort gibt. Hier sind die häufigsten Fragen, jeweils mit einer Musterantwort. Senior: Architektur, Trade-offs, Mentoring und Entscheidungsfindung.

Probier es aus — kein Konto nötig
Deine Frage wird vorbereitet…

Themen zur Vorbereitung

Advanced SQL
Datenmodellierung und Warehousing
ETL vs. ELT und Orchestrierung
Spark und verteilte Verarbeitung
Streaming und Kafka
Datenqualität

6 Fragen auf Senior-Niveau mit Antworten

1

Was ist der Unterschied zwischen Partitionierung und Sharding?

Antwort

Partitionierung teilt eine Tabelle innerhalb einer Datenbank auf, damit die Engine irrelevante Teile überspringen kann; Sharding verteilt Daten über separate Datenbanken, von denen jede eine Teilmenge hält. Partitionierung ist ein Werkzeug für Performance und Wartung, Sharding ein Skalierungswerkzeug mit echten Kosten — Shard-übergreifende Abfragen und Transaktionen werden schwierig oder unmöglich. Zu Sharding zu greifen, bevor Partitionierung und Indizierung ausgereizt sind, ist ein häufiger und teurer Fehler.

2

Wie gehst du mit Schema-Evolution um, wenn sich die Quelle ändert?

Antwort

Indem du ein Format wählst, das das Schema mitträgt und Evolution unterstützt — Avro oder Parquet mit einer Schema-Registry —, und im Voraus festlegst, welche Änderungen kompatibel sind: Ein optionales Feld hinzuzufügen meist schon, ein Feld zu entfernen oder umzutypisieren meist nicht. Die Staging-Zone sollte die neue Form akzeptieren, ohne den gesamten Load scheitern zu lassen, und der Fehlermodus, gegen den man designen muss, ist eine stille Typerweiterung, die nachgelagerte Aggregate korrumpiert.

3

Wie misst und automatisierst du Datenqualität?

Antwort

Anhand benannter Dimensionen — Vollständigkeit, Eindeutigkeit, Validität, Aktualität, Konsistenz —, jede ausgedrückt als Check mit einem Schwellenwert statt als Bauchgefühl. Automatisierung bedeutet, dass die Checks Teil der Pipeline sind und sie stoppen können, denn ein Qualitätsreport, den niemand liest, ist keine Qualitätskontrolle. Die Dimension, die am häufigsten übersprungen wird, ist Aktualität — und veraltete Daten, die korrekt aussehen, richten mehr Schaden an als offensichtlich fehlende Daten.

4

Ein Job, der früher zwanzig Minuten brauchte, braucht jetzt vier Stunden. Wie findest du die Ursache?

Antwort

Ich fange damit an, was sich geändert hat: Datenvolumen, Skew, Clustergröße oder der Code. Dann schaue ich mir die Stage-Ansicht an — eine Stage, die den Großteil der Zeit verbraucht, bedeutet meist einen Shuffle, und einzelne Tasks, die deutlich länger brauchen als der Rest, bedeuten Skew. Skew ist häufiger die Antwort, als man erwartet, und die Lösungen sind Salting des Schlüssels, das Broadcasten der kleinen Seite oder ein Repartitioning.

5

Was ist Medallion-Architektur, und welches Problem löst sie?

Antwort

Bronze hält die roh eingelesenen Daten, Silver hält bereinigte und vereinheitlichte Daten, Gold hält Aggregate auf Business-Ebene. Das Problem, das sie löst: Transformationen verheddern sich, wenn jeder liest, wo es gerade bequem ist — mit klaren Schichten bleibt die Lineage nachvollziehbar, und ein fehlerhafter Load kann aus Bronze neu verarbeitet werden, ohne erneut aus der Quelle einzulesen. Es ist eine Konvention und keine Technologie, und ihr ganzer Wert liegt darin, dass sie auch eingehalten wird.

6

Wann akzeptierst du Eventual Consistency in einer Datenplattform?

Antwort

Für Analytics fast immer, weil ein Dashboard, das eine Minute hinterherhinkt, nichts ändert, und der Preis starker Konsistenz in einem verteilten Store die Verfügbarkeit während einer Partition ist. Du akzeptierst es nicht dort, wo eine nachgelagerte Entscheidung finanziell oder regulatorisch ist, oder wo zwei Systeme sich im selben Moment auf eine Zahl einigen müssen. Wichtig ist, dass diese Entscheidung explizit getroffen und dokumentiert wird — der Fehlermodus ist, sie erst während eines Audits zu entdecken.

🦎

Antworten lesen reicht nicht

Im echten Interview sprichst du unter Druck. Cam stellt genau diese Fragen, bewertet jede Antwort und zeigt dir genau, was du verbessern musst.

Senior Data Engineer-Interview üben →
Kostenlos · 3 Interviews im Monat

Weitere Level — Data Engineer

Junior Data EngineerMiddle Data EngineerAlle Data Engineer-Fragen

Weitere Spezialisierungen

🔍Senior QA Manual🤖Senior QA AutomationSenior Java Backend🐍Senior Python Backend🐘Senior PHP-Backend🦫Senior Go-Backend🟢Senior Node.js-Backend💎Senior Ruby on Rails🔷Senior C++🟨Senior JavaScript