P
prepair.app
Пройти інтерв'ю →
EnglishУкраїнськаРусскийDeutsch
📊

Питання на співбесіді data scientist

Співбесіда дата-сайентиста перевіряє одразу три речі: чи справді ви розумієте статистику, а не переказуєте визначення; чи вмієте самі дістати й обробити дані через SQL і pandas; і чи здатні перетворити модель на рішення, на основі якого хтось реально діятиме. Нижче питання, які ставлять найчастіше, кожне з еталонною відповіддю.

Junior · без досвіду / до 1 рокуMiddle · 2–4 роки досвідуSenior · 5+ років досвіду

Що запитують

Основи статистики та теорії ймовірностей
Перевірка гіпотез, p-value, довірчі інтервали
SQL і обробка даних у pandas
Регресія, класифікація, feature engineering
A/B-тестування та дизайн експериментів
Causal inference і комунікація результатів

9 реальних питань з відповідями

До кожного питання — еталонна відповідь, з якою можна порівняти свою.

1

Коли варто показувати медіану замість середнього?

Відповідь

Коли розподіл скошений або є викиди, які середнє не переживає, — дохід, затримки, час до покупки. Одна зарплата топ-менеджера чи один запит на 30 секунд тягне середнє туди, де насправді не сидить жодна типова точка даних, а медіана лишається там, де основна маса даних. На практиці показують обидва плюс перцентиль на кшталт p95, бо розрив між середнім і медіаною сам по собі інформативний щодо скошеності.

2

Що насправді означає p-value і в чому найчастіша помилка його трактування?

Відповідь

P-value — це ймовірність побачити дані настільки екстремальні (чи більш екстремальні) за умови, що нульова гіпотеза правдива, — це не ймовірність того, що нульова гіпотеза правдива, і не ймовірність, що результат випадковий. Часта помилка — трактувати p < 0.05 як «95% впевненості, що ефект реальний», що плутає твердження про дані за умови гіпотези з твердженням про гіпотезу за умови даних. Саме ця плутанина штовхає до p-hacking: прожени достатньо тестів, і один перетне поріг 0.05 просто випадково.

3

Що насправді каже 95%-й довірчий інтервал?

Відповідь

Якщо повторити процедуру вибірки багато разів і щоразу будувати інтервал тим самим способом, 95% таких інтервалів накриють істинний параметр — це твердження про процедуру, а не про те, що конкретний інтервал з імовірністю 95% містить істинне значення. Широкий інтервал — чесна інформація: зазвичай означає, що вибірка замала, аби щось стверджувати, а точкова оцінка без нього — число, що вдає впевненість більшу, ніж дозволяють дані.

4

Коли в SQL ви берете віконну функцію замість GROUP BY?

Відповідь

GROUP BY згортає рядки в один на групу, і ви втрачаєте деталізацію по рядках. Віконна функція на кшталт ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY created_at) рахує значення по розділу, але зберігає кожен рядок — це потрібно для «останнього замовлення клієнта», накопичувальних підсумків чи рангу всередині групи. Тягнутися до self-join або підзапиту там, де впоралася б віконна функція, — класична ознака людини, яка вивчила SQL до того, як віконні функції стали звичними.

5

Як обрати між регресією і класифікацією для однієї бізнес-задачі?

Відповідь

Усе залежить від того, чим реально є таргет і як використовуватиметься результат, а не від того, яка модель показує кращі метрики у відриві від контексту. «Чи піде користувач за 30 днів» — природна класифікація з порогом, який налаштовують під бізнес-ціну хибнопозитивних і хибнонегативних спрацювань; «скільки виручки принесе цей акаунт» — регресія, і перетворення її на кошики викидає інформацію, яку бізнес зазвичай потребує. Іноді чесна відповідь — моделювати неперервний таргет і вже з нього виводити класифікацію, щоб не зашивати довільний поріг прямо в модель.

6

Поясніть trade-off між зміщенням і дисперсією на конкретному прикладі.

Відповідь

Модель із високим зміщенням — наприклад, лінійна регресія на даних з реальною кривизною — недонавчається: стабільно помиляється в один бік і на train, і на test. Модель із високою дисперсією — глибоке, необрізане дерево рішень — перенавчається: запамʼятовує шум навчальної вибірки, і якість сильно стрибає між train і test. Регуляризація, крос-валідація і простіший набір ознак міняють частину зміщення на реальне зниження дисперсії, і мета — знайти точку, де мінімальна саме помилка на test, а не на train.

7

Як визначити розмір вибірки перед запуском A/B-тесту?

Відповідь

Потрібні чотири вхідні дані: базова конверсія, мінімальний детектований ефект, який взагалі варто помічати, статистична потужність (зазвичай 80%) і рівень значущості (зазвичай 0.05). Що менший ефект і вища потрібна потужність, то більше трафіку потрібно, тому команди, які пропускають цей крок, або ганяють недостатньо потужні тести, нездатні помітити реальний ефект, або місяцями тестують зміну, надто дрібну, щоб мати значення. Розрахунок потужності до запуску перетворює «тест не показав різниці» зі знизування плечима на реальну відповідь.

8

Які найчастіші причини того, що A/B-тест дає невірну відповідь, навіть коли статистику пораховано правильно?

Відповідь

Підглядання в результати й зупинка тесту, щойно він виглядає значущим, роздуває частку хибнопозитивних спрацювань значно вище за 5%, бо фактично ви прогонюєте безліч неявних тестів у часі. Sample ratio mismatch — коли фактичний розподіл відхиляється від заданих 50/50 — зазвичай вказує на баг у логіці розподілу і робить результат недійсним ще до того, як ви подивилися на метрику. Ефект новизни роздуває короткостроковий приріст, що потім згасає, а мережеві ефекти між тестовою й контрольною групами (два користувачі з одного соціального графа в різних плечах) порушують припущення про незалежність, на якому тримається статистика тесту.

9

Чому кореляція не означає причинність і які інструменти застосовувати, коли поставити експеримент неможливо?

Відповідь

Дві змінні можуть рухатися разом тому, що одна спричиняє іншу, тому що третя змінна спричиняє обидві (конфаундер), або просто збігом на достатньо великому датасеті. Коли рандомізація неможлива, застосовують квазіекспериментальні схеми: difference-in-differences, регресійний розрив (regression discontinuity) навколо порогу, інструментальні змінні чи propensity score matching, щоб наблизити рандомізоване порівняння на спостережних даних. Кожна з них спирається на припущення, яке не можна повністю перевірити, тож чесна видача — це оцінка плюс чіткий опис того, що могло б її зламати.

🦎

Прочитати відповіді недостатньо

На співбесіді ти говориш вголос під тиском. Кем поставить ті самі питання, оцінить кожну відповідь і покаже, що саме підтягнути.

Пройти інтерв'ю Data Scientist →
Безкоштовно · 3 інтерв'ю на місяць

Варто прочитати

Всі статті →

Інші спеціалізації

🔍QA Manual🤖QA AutomationJava Backend🐍Python Backend🐘PHP Backend🦫Go Backend🟢Node.js Backend💎Ruby on Rails🟣.NET Backend Developer🔷C++🟨JavaScript⚛️React Frontend💚Vue Frontend🅰️Angular FrontendNext.js🍏iOS (Swift)🟩Android (Kotlin)📱React Native Developer⚙️DevOps / SRE🗄️Data Engineer🧠AI/ML Engineer📈Business Analyst🎯Product Manager📋Project Manager🎨UI/UX Designer📣Marketing🧑‍💼HR / Recruiter🤝Sales / Account Manager🎧Technical Support Engineer