P
prepair.app
Пройти интервью →
EnglishУкраїнськаРусскийDeutsch
📊

Junior Data ScientistВопросы на собеседовании data scientist

Junior · без опыта / до 1 года

Собеседование дата-сайентиста проверяет сразу три вещи: понимаете ли вы статистику по сути, а не пересказываете определения; умеете ли сами вытащить и обработать данные через SQL и pandas; и способны ли превратить модель в решение, на основе которого кто-то реально будет действовать. Ниже вопросы, которые задают чаще всего, каждый с эталонным ответом. Junior: базовая теория, определения и простые практические кейсы.

Попробовать — без регистрации
Готовим вопрос…

Темы для подготовки

Основы статистики и теории вероятностей
Проверка гипотез, p-value, доверительные интервалы
SQL и обработка данных в pandas
Регрессия, классификация, feature engineering
A/B-тестирование и дизайн экспериментов
Causal inference и коммуникация результатов

6 вопросов уровня Junior с ответами

1

В чём разница между статистикой генеральной совокупности и выборки, и почему это меняет формулы?

Ответ

Статистика генеральной совокупности описывает всех, кто вас интересует; выборочная статистика оценивает её по подмножеству, и эта оценка добавляет неопределённость, которой нет у параметра генеральной совокупности. Конкретно это проявляется в дисперсии: деление на n-1 вместо n для выборочной дисперсии (поправка Бесселя) исправляет смещение, которое иначе систематически занижало бы истинную дисперсию генеральной совокупности.

2

В чём разница между корреляцией и причинностью простыми словами?

Ответ

Корреляция означает, что две переменные двигаются вместе; причинность означает, что одна порождает изменение в другой. Продажи мороженого и число утоплений коррелируют, потому что оба растут летом в жару, — ни одно не вызывает другое. Трактовать корреляцию как причинность без контролируемого сравнения или правдоподобного механизма — самая частая аналитическая ошибка джунов.

3

Как бы вы соединили две таблицы в SQL и в чём разница между INNER и LEFT JOIN?

Ответ

INNER JOIN оставляет только строки, совпавшие по ключу соединения в обеих таблицах; LEFT JOIN оставляет каждую строку левой таблицы и подставляет NULL там, где совпадения справа нет. Взять INNER JOIN по умолчанию, когда на самом деле нужен LEFT JOIN, тихо теряет строки — клиенты без заказов просто исчезают вместо того, чтобы показаться с нулём, и это незаметно искажает любую агрегацию сверху.

4

Что говорит нормальное распределение и что ломает это допущение в реальных данных?

Ответ

Нормальное распределение симметрично относительно среднего, около 68% значений попадают в одно стандартное отклонение и 95% — в два, и на нём построены большинство классических статистических тестов. Реальные бизнес-данные часто не нормальны: выручка и длительность сессии скошены вправо с длинным хвостом, а количество редких событий подчиняется скорее распределению Пуассона, поэтому распределение проверяют до того, как считать применимым t-тест.

5

В чём разница между `.loc` и `.iloc` в pandas?

Ответ

.loc выбирает по метке — реальному индексу или имени столбца, а .iloc — по целочисленной позиции независимо от меток. Они болезненно расходятся после фильтрации или сортировки DataFrame, потому что позиционный порядок больше не совпадает с исходным индексом: .iloc[0] там даёт первую строку текущего среза, а не «индекс 0».

6

Что такое p-hacking и как случайно не заняться этим?

Ответ

P-hacking — это прогон множества анализов: разных метрик, разных срезов данных, разных временных окон, — пока один не пересечёт p < 0.05, и потом выдача только его так, будто это был единственный запланированный тест. Это случается непреднамеренно, когда проверяют дашборд каждый день и останавливаются, как только метрика выглядит значимой. Лечится предварительной фиксацией того, что и когда будете измерять, до того как придут данные, а не после.

🦎

Прочитать ответы недостаточно

На собеседовании ты говоришь вслух под давлением. Кем задаст эти же вопросы, оценит каждый ответ и покажет, что именно подтянуть.

Пройти интервью Junior Data Scientist →
Бесплатно · 3 интервью в месяц

Другие уровни — Data Scientist

Middle Data ScientistSenior Data ScientistВсе вопросы Data Scientist

Другие специализации

🔍Junior QA Manual🤖Junior QA AutomationJunior Java Backend🐍Junior Python Backend🐘Junior PHP Backend🦫Junior Go Backend🟢Junior Node.js Backend💎Junior Ruby on Rails🟣Junior .NET Backend Developer🔷Junior C++