P
prepair.app
Interview starten →
EnglishУкраїнськаРусскийDeutsch
📊

Junior Data ScientistData-Scientist-Interviewfragen

Junior · keine Erfahrung / unter 1 Jahr

Data-Science-Interviews prüfen drei Dinge gleichzeitig: ob du Statistik wirklich verstehst statt Definitionen aufzusagen, ob du selbst Daten mit SQL und pandas ziehen und aufbereiten kannst, und ob du aus einem Modell eine Entscheidung machen kannst, nach der jemand tatsächlich handelt. Hier sind die am häufigsten gestellten Fragen, jeweils mit einer Musterantwort. Junior: Grundlagentheorie, Definitionen und einfache Praxisfälle.

Probier es aus — kein Konto nötig
Deine Frage wird vorbereitet…

Themen zur Vorbereitung

Statistik- und Wahrscheinlichkeitsgrundlagen
Hypothesentests, p-Werte, Konfidenzintervalle
SQL und Datenmanipulation mit pandas
Regression, Klassifikation, Feature Engineering
A/B-Tests und Experimentdesign
Kausalinferenz und Kommunikation von Ergebnissen

6 Fragen auf Junior-Niveau mit Antworten

1

Was ist der Unterschied zwischen Populations- und Stichprobenstatistik, und warum ändert das deine Formeln?

Antwort

Eine Populationsstatistik beschreibt alle, die dich interessieren; eine Stichprobenstatistik schätzt sie aus einer Teilmenge, und diese Schätzung fügt Unsicherheit hinzu, die ein Populationsparameter nicht hat. Konkret zeigt sich das bei der Varianz: Die Division durch n-1 statt n bei der Stichprobenvarianz (Bessel-Korrektur) korrigiert einen Bias, der die wahre Populationsvarianz sonst systematisch unterschätzen würde.

2

Was ist der Unterschied zwischen Korrelation und Kausalität, ganz einfach erklärt?

Antwort

Korrelation bedeutet, dass sich zwei Variablen gemeinsam bewegen; Kausalität bedeutet, dass eine eine Veränderung in der anderen bewirkt. Eisverkäufe und Ertrinkungsfälle korrelieren, weil beide bei sommerlicher Hitze steigen — keines verursacht das andere. Eine Korrelation ohne kontrollierten Vergleich oder plausiblen Mechanismus als kausal zu behandeln, ist der häufigste analytische Fehler von Junior-Analysten.

3

Wie würdest du zwei Tabellen in SQL verbinden, und was ist der Unterschied zwischen INNER und LEFT JOIN?

Antwort

INNER JOIN behält nur Zeilen, die in beiden Tabellen auf dem Join-Key übereinstimmen; LEFT JOIN behält jede Zeile der linken Tabelle und füllt NULLs ein, wo es rechts keine Übereinstimmung gibt. Standardmäßig INNER JOIN zu wählen, wenn du eigentlich LEFT JOIN brauchst, lässt still Zeilen verschwinden — Kunden ohne Bestellungen fallen komplett weg, statt mit einer Null aufzutauchen, was jede darauf aufbauende Aggregation unbemerkt verzerrt.

4

Was sagt dir eine Normalverteilung, und was bricht diese Annahme in realen Daten?

Antwort

Eine Normalverteilung ist symmetrisch um ihren Mittelwert, mit rund 68 % der Werte innerhalb einer Standardabweichung und 95 % innerhalb von zwei — sie liegt den meisten klassischen statistischen Tests zugrunde. Reale Business-Daten sind oft nicht normalverteilt: Umsatz und Sitzungsdauer sind rechtsschief mit einem langen Tail, und Zählungen seltener Ereignisse folgen eher einer Poisson-Form, weshalb du die Verteilung prüfst, bevor du einen t-Test für gültig hältst.

5

Was ist der Unterschied zwischen `.loc` und `.iloc` in pandas?

Antwort

.loc selektiert über Labels — den tatsächlichen Index oder Spaltennamen — während .iloc über die Integer-Position selektiert, unabhängig davon, wie die Labels lauten. Sie klaffen schmerzhaft auseinander, nachdem ein DataFrame gefiltert oder sortiert wurde, weil die positionelle Reihenfolge nicht mehr zum ursprünglichen Index passt; .iloc[0] liefert dann die erste Zeile der aktuellen Ansicht, nicht „Index 0".

6

Was ist p-Hacking, und wie vermeidest du es unabsichtlich?

Antwort

P-Hacking bedeutet, viele Analysen durchzuführen — verschiedene Metriken, verschiedene Daten-Cuts, verschiedene Zeitfenster —, bis eine p < 0,05 überschreitet, und dann nur diese eine so zu berichten, als wäre sie der einzige geplante Test gewesen. Es passiert unabsichtlich, wenn du täglich ein Dashboard checkst und in dem Moment stoppst, in dem eine Metrik signifikant aussieht. Der Fix ist, vorab festzulegen, was du wann misst, bevor die Daten überhaupt eintreffen, nicht danach.

🦎

Antworten lesen reicht nicht

Im echten Interview sprichst du unter Druck. Cam stellt genau diese Fragen, bewertet jede Antwort und zeigt dir genau, was du verbessern musst.

Junior Data Scientist-Interview üben →
Kostenlos · 3 Interviews im Monat

Weitere Level — Data Scientist

Middle Data ScientistSenior Data ScientistAlle Data Scientist-Fragen

Weitere Spezialisierungen

🔍Junior QA Manual🤖Junior QA AutomationJunior Java Backend🐍Junior Python Backend🐘Junior PHP-Backend🦫Junior Go-Backend🟢Junior Node.js-Backend💎Junior Ruby on Rails🟣Junior .NET Backend Developer🔷Junior C++