P
prepair.app
Пройти интервью →
EnglishУкраїнськаРусскийDeutsch
📊

Вопросы на собеседовании data scientist

Собеседование дата-сайентиста проверяет сразу три вещи: понимаете ли вы статистику по сути, а не пересказываете определения; умеете ли сами вытащить и обработать данные через SQL и pandas; и способны ли превратить модель в решение, на основе которого кто-то реально будет действовать. Ниже вопросы, которые задают чаще всего, каждый с эталонным ответом.

Junior · без опыта / до 1 годаMiddle · 2–4 года опытаSenior · 5+ лет опыта

Что спрашивают

Основы статистики и теории вероятностей
Проверка гипотез, p-value, доверительные интервалы
SQL и обработка данных в pandas
Регрессия, классификация, feature engineering
A/B-тестирование и дизайн экспериментов
Causal inference и коммуникация результатов

9 реальных вопросов с ответами

К каждому вопросу — эталонный ответ, с которым можно сравнить свой.

1

Когда стоит показывать медиану вместо среднего?

Ответ

Когда распределение скошено или есть выбросы, которые среднее не переживает, — доход, задержки, время до покупки. Одна зарплата топ-менеджера или один запрос на 30 секунд утаскивает среднее туда, где реально не сидит ни одна типичная точка данных, а медиана остаётся там, где основная масса данных. На практике показывают и то, и другое плюс перцентиль вроде p95, потому что разрыв между средним и медианой сам по себе информативен насчёт скошенности.

2

Что на самом деле означает p-value и в чём самая частая ошибка его трактовки?

Ответ

P-value — это вероятность увидеть данные настолько экстремальные (или более) при условии, что нулевая гипотеза верна, — это не вероятность того, что нулевая гипотеза верна, и не вероятность, что результат случаен. Частая ошибка — трактовать p < 0.05 как «95% уверенности, что эффект реален», что путает утверждение о данных при условии гипотезы с утверждением о гипотезе при условии данных. Именно эта путаница толкает к p-hacking: прогони достаточно тестов, и один перейдёт порог 0.05 просто по случайности.

3

Что на самом деле говорит 95%-й доверительный интервал?

Ответ

Если повторить процедуру выборки много раз и каждый раз строить интервал тем же способом, 95% таких интервалов накроют истинный параметр — это утверждение о процедуре, а не о том, что данный конкретный интервал с вероятностью 95% содержит истинное значение. Широкий интервал — честная информация: обычно он значит, что выборка слишком мала, чтобы что-то утверждать, а точечная оценка без него — число, притворяющееся увереннее, чем позволяют данные.

4

Когда в SQL вы берёте оконную функцию вместо GROUP BY?

Ответ

GROUP BY схлопывает строки в одну на группу, и вы теряете детализацию по строкам. Оконная функция вроде ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY created_at) считает значение по разделу, но сохраняет каждую строку — это нужно для «последнего заказа клиента», накопительных итогов или ранга внутри группы. Тянуться к self-join или подзапросу там, где справилась бы оконная функция, — классический признак человека, выучившего SQL до того, как оконные функции стали обыденностью.

5

Как выбрать между регрессией и классификацией для одной и той же бизнес-задачи?

Ответ

Всё зависит от того, что реально представляет собой таргет и как будет использоваться результат, а не от того, какая модель показывает метрики лучше в отрыве от контекста. «Уйдёт ли пользователь за 30 дней» — естественная классификация с порогом, который настраивают под бизнес-цену ложноположительных и ложноотрицательных срабатываний; «сколько выручки принесёт этот аккаунт» — регрессия, и превращение её в корзины выбрасывает информацию, которая бизнесу обычно нужна. Иногда честный ответ — моделировать непрерывный таргет и уже из него выводить классификацию, чтобы не зашивать произвольный порог прямо в модель.

6

Объясните trade-off между смещением и дисперсией на конкретном примере.

Ответ

Модель с высоким смещением — например, линейная регрессия на данных с реальной кривизной — недообучается: стабильно ошибается в одну сторону и на train, и на test. Модель с высокой дисперсией — глубокое, необрезанное дерево решений — переобучается: запоминает шум обучающей выборки, и качество сильно скачет между train и test. Регуляризация, кросс-валидация и более простой набор фич меняют часть смещения на реальное снижение дисперсии, и цель — найти точку, где минимальна именно ошибка на test, а не на train.

7

Как определить размер выборки перед запуском A/B-теста?

Ответ

Нужны четыре входа: базовая конверсия, минимальный детектируемый эффект, который вообще стоит замечать, статистическая мощность (обычно 80%) и уровень значимости (обычно 0.05). Чем меньше эффект и выше требуемая мощность, тем больше трафика нужно, поэтому команды, пропускающие этот шаг, либо гоняют недостаточно мощные тесты, не способные заметить реальный эффект, либо месяцами тестируют изменение, слишком мелкое, чтобы иметь значение. Расчёт мощности до запуска превращает «тест не показал разницы» из пожимания плечами в реальный ответ.

8

Какие самые частые причины того, что A/B-тест даёт неверный ответ, даже когда статистика посчитана правильно?

Ответ

Подглядывание в результаты и остановка теста, как только он выглядит значимым, раздувает частоту ложноположительных срабатываний намного выше 5%, потому что фактически вы прогоняете множество неявных тестов во времени. Sample ratio mismatch — когда фактическое разбиение отклоняется от заданных 50/50 — обычно указывает на баг в логике распределения и делает результат недействительным ещё до того, как вы посмотрели на метрику. Эффект новизны раздувает краткосрочный прирост, который затем угасает, а сетевые эффекты между тестовой и контрольной группами (два пользователя из одного социального графа в разных плечах) нарушают предположение о независимости, на котором держится статистика теста.

9

Почему корреляция не означает причинность и какие инструменты использовать, когда эксперимент поставить нельзя?

Ответ

Две переменные могут двигаться вместе потому, что одна вызывает другую, потому что третья переменная вызывает обе (конфаундер), или просто по совпадению на достаточно большом датасете. Когда рандомизация невозможна, применяют квазиэкспериментальные схемы: разность разностей (difference-in-differences), регрессионный разрыв (regression discontinuity) вокруг порога, инструментальные переменные или propensity score matching, чтобы приблизить рандомизированное сравнение на наблюдательных данных. Каждая из них опирается на допущение, которое нельзя полностью проверить, поэтому честная выдача — это оценка плюс чёткое описание того, что могло бы её сломать.

🦎

Прочитать ответы недостаточно

На собеседовании ты говоришь вслух под давлением. Кем задаст эти же вопросы, оценит каждый ответ и покажет, что именно подтянуть.

Пройти интервью Data Scientist →
Бесплатно · 3 интервью в месяц

Стоит прочитать

Все статьи →

Другие специализации

🔍QA Manual🤖QA AutomationJava Backend🐍Python Backend🐘PHP Backend🦫Go Backend🟢Node.js Backend💎Ruby on Rails🟣.NET Backend Developer🔷C++🟨JavaScript⚛️React Frontend💚Vue Frontend🅰️Angular FrontendNext.js🍏iOS (Swift)🟩Android (Kotlin)📱React Native Developer⚙️DevOps / SRE🗄️Data Engineer🧠AI/ML Engineer📈Business Analyst🎯Product Manager📋Project Manager🎨UI/UX Designer📣Marketing🧑‍💼HR / Recruiter🤝Sales / Account Manager🎧Technical Support Engineer