P
prepair.app
Пройти интервью →
EnglishУкраїнськаРусскийDeutsch
🧠

Вопросы на собеседовании AI/ML-инженера

Собеседование AI/ML-инженера сочетает две вещи: классическую теорию машинного обучения — ту, которую спрашивают у доски, — и современный стек вокруг Python, PyTorch или TensorFlow, а также всё чаще трансформеры и LLM. Ниже вопросы, которые задают чаще всего, каждый с эталонным ответом.

Junior · без опыта / до 1 годаMiddle · 2–4 года опытаSenior · 5+ лет опыта

Что спрашивают

Обучение с учителем, без учителя и с подкреплением
Оценка моделей и компромисс bias-variance
Нейросети, backpropagation и оптимизация
Трансформеры, attention и файнтюнинг LLM
RAG, эмбеддинги и векторные базы данных
MLOps: serving, мониторинг и дрейф данных

9 реальных вопросов с ответами

К каждому вопросу — эталонный ответ, с которым можно сравнить свой.

1

В чём разница между обучением с учителем и без учителя?

Ответ

Обучение с учителем идёт на размеченных примерах — есть входы и правильные выходы, и модель учится сопоставлять одно с другим, как в классификации или регрессии. Обучение без учителя работает без меток: модель сама ищет структуру в данных, как в кластеризации или снижении размерности. Обучение с подкреплением — третья категория, где агент учится на сигналах вознаграждения от собственных действий, а не на фиксированном датасете.

2

Что такое переобучение и как с ним бороться?

Ответ

Переобучение — это когда модель запоминает обучающие данные вместе с шумом вместо того, чтобы выучить закономерность, поэтому она хорошо работает на train и плохо на новых данных. С этим борются регуляризацией (L1/L2), dropout в нейросетях, увеличением объёма данных, ранней остановкой или просто уменьшением модели. Недообучение — обратная проблема: модель слишком проста, чтобы уловить закономерность вообще, и метрики плохи и на train, и на validation.

3

Зачем делить данные на train, validation и test?

Ответ

На train модель обучается. Validation используют в процессе разработки для подбора гиперпараметров и выбора между моделями, не трогая настоящий отложенный набор. Test трогают ровно один раз, в самом конце, чтобы получить число, которому можно доверять — если подгонять модель по нему, оно перестаёт что-либо значить, и это ошибка, которую до сих пор встречают в реальных пайплайнах.

4

Когда accuracy — неправильная метрика и что использовать вместо неё?

Ответ

Accuracy вводит в заблуждение на несбалансированных данных — модель, которая всегда предсказывает "не мошенничество", даст 99% accuracy на датасете, где 99% транзакций легитимны, и будет бесполезна. Precision показывает, сколько из предсказанных положительных были действительно положительными; recall — сколько из реально положительных модель поймала; F1 — их среднее гармоническое, когда нужно одно число. ROC-AUC удобен для сравнения моделей по всем порогам сразу, но precision-recall кривые честнее на сильно несбалансированных классах.

5

Что такое backpropagation?

Ответ

Это алгоритм, вычисляющий вклад каждого веса нейросети в ошибку с помощью цепного правила, распространяя градиент функции потерь от выходного слоя к входному. Каждый вес затем сдвигают в направлении, уменьшающем потери, с шагом, заданным learning rate. Никакой магии — это эффективно применённое матанализ, переиспользующее промежуточные вычисления слой за слоем вместо пересчёта с нуля.

6

Что такое механизм attention в трансформере?

Ответ

Attention позволяет каждому токену последовательности "смотреть" на все остальные токены и решать, насколько сильно их учитывать при построении собственного представления, вместо строго последовательной обработки, как в RNN. Self-attention считает векторы query, key и value для каждого токена, и скалярное произведение query и key даёт вес внимания. Именно это позволяет трансформерам параллельно моделировать дальние зависимости и является главной причиной, почему они вытеснили RNN в большинстве задач NLP.

7

Когда файнтюнить модель, а когда достаточно промптинга?

Ответ

Промптинг — включая few-shot примеры в контексте — быстрее итерируется, не требует инфраструктуры обучения и хорошо работает, когда задача близка к тому, что базовая модель уже умеет. Файнтюнинг оправдан, когда нужен надёжный конкретный формат вывода, когда словарь домена сильно отличается от данных общего обучения, или когда нужно закрепить поведение, которое промпт не может гарантировать надёжно. На практике большинство команд сначала пробуют промптинг и RAG и файнтюнят только тогда, когда упираются в реальный потолок.

8

Что такое RAG (retrieval-augmented generation) и зачем он нужен?

Ответ

RAG достаёт релевантные документы из векторной базы данных — обычно через сходство эмбеддингов — и подставляет их в промпт, чтобы модель отвечала, опираясь на этот контекст, а не только на данные обучения. Это стандартное решение проблемы галлюцинаций на доменных или быстро меняющихся знаниях, потому что обновить индекс намного дешевле, чем переобучить модель. Плата за это — качество ответа теперь сильно зависит от качества retrieval: неудачная стратегия чанкинга или устаревший индекс эмбеддингов незаметно даёт плохие ответы.

9

Как мониторить модель в продакшене и что такое дрейф данных?

Ответ

Отслеживают распределения предсказаний, распределения входных признаков и итоговые реальные исходы, когда они становятся известны, сравнивая их с тем, что модель видела при обучении. Дрейф данных — это когда распределение входов меняется со временем: меняется поведение пользователей, открывается новый рынок, перекалибруется датчик, — и модель, точная на момент обучения, постепенно перестаёт быть точной по причинам, не связанным с самой моделью. Поймать это можно только мониторя входы, а не дожидаясь, пока деградация станет заметна по метрикам accuracy, — к тому моменту реальный вред уже нанесён.

🦎

Прочитать ответы недостаточно

На собеседовании ты говоришь вслух под давлением. Кем задаст эти же вопросы, оценит каждый ответ и покажет, что именно подтянуть.

Пройти интервью AI/ML Engineer →
Бесплатно · 3 интервью в месяц

Стоит прочитать

Все статьи →

Другие специализации

🔍QA Manual🤖QA AutomationJava Backend🐍Python Backend🐘PHP Backend🦫Go Backend🟢Node.js Backend💎Ruby on Rails🟣.NET Backend Developer🔷C++🟨JavaScript⚛️React Frontend💚Vue Frontend🅰️Angular FrontendNext.js🍏iOS (Swift)🟩Android (Kotlin)📱React Native Developer⚙️DevOps / SRE🗄️Data Engineer📊Data Scientist📈Business Analyst🎯Product Manager📋Project Manager🎨UI/UX Designer📣Marketing🧑‍💼HR / Recruiter🤝Sales / Account Manager🎧Technical Support Engineer