P
prepair.app
Пройти интервью →
EnglishУкраїнськаРусскийDeutsch
🧠

Senior AI/ML EngineerВопросы на собеседовании AI/ML-инженера

Senior · 5+ лет опыта

Собеседование AI/ML-инженера сочетает две вещи: классическую теорию машинного обучения — ту, которую спрашивают у доски, — и современный стек вокруг Python, PyTorch или TensorFlow, а также всё чаще трансформеры и LLM. Ниже вопросы, которые задают чаще всего, каждый с эталонным ответом. Senior: архитектуру, трейд-оффы, менторство и принятие решений.

Попробовать — без регистрации
Готовим вопрос…

Темы для подготовки

Обучение с учителем, без учителя и с подкреплением
Оценка моделей и компромисс bias-variance
Нейросети, backpropagation и оптимизация
Трансформеры, attention и файнтюнинг LLM
RAG, эмбеддинги и векторные базы данных
MLOps: serving, мониторинг и дрейф данных

5 вопросов уровня Senior с ответами

1

Объясните KV-кэширование и квантование в инференсе LLM — почему они важны?

Ответ

KV-кэш хранит векторы key и value, посчитанные для предыдущих токенов, так что генерация каждого нового токена требует attention только для этого одного нового токена вместо пересчёта всей последовательности — без этого авторегрессивная генерация была бы квадратично медленнее. Квантование снижает точность весов (например, с FP16 до INT8 или INT4), уменьшая потребление памяти и повышая пропускную способность, обменивая небольшую, обычно приемлемую потерю качества на значительное снижение стоимости serving. Именно эти два приёма делают экономически возможным обслуживание модели на 70 миллиардов параметров вообще.

2

Что такое RLHF и какую проблему он на самом деле решает?

Ответ

RLHF (reinforcement learning from human feedback) берёт модель, уже обученную предсказывать следующий токен, и дополнительно настраивает её выдавать то, что люди действительно предпочитают, — обычно обучая reward-модель на сравнениях ответов людьми, а затем используя эту reward-модель для файнтюнинга политики алгоритмом вроде PPO. Он закрывает разрыв между "предсказывает правдоподобный текст" и "полезен, честен и следует инструкциям", который чистое предсказание следующего токена вообще не оптимизирует. Более новые подходы вроде DPO дают похожий результат без отдельной reward-модели и RL-цикла, поэтому команды всё чаще пропускают классический пайплайн RLHF.

3

Чем различаются data, model и pipeline parallelism и как выбирать между ними?

Ответ

Data parallelism реплицирует всю модель на устройствах и делит батч — это просто, но требует, чтобы вся модель помещалась на одном устройстве. Model parallelism делит саму модель между устройствами, когда она слишком велика для одного: tensor parallelism делит отдельные слои, pipeline parallelism делит модель на стадии, обрабатываемые последовательно. На практике обучение большой модели использует все три сразу, и реальная инженерная задача — минимизировать накладные расходы на коммуникацию между устройствами, что и определяет реальную пропускную способность.

4

Как решить, строить ли на API фундаментальной модели, файнтюнить открытую модель или обучать с нуля?

Ответ

Обучение с нуля почти никогда не оправдано вне горстки хорошо профинансированных лабораторий — стоимость данных и вычислений огромна, а получаемая базовая способность хуже уже существующей. Настоящий выбор — между API и self-hosted открытой моделью: API быстрее запустить и не нужно владеть инфраструктурой, но расходы растут линейно с использованием, и вы зависите от чужого аптайма и лимитов; self-hosted файнтюненная модель требует инженерных затрат заранее, но даёт контроль над данными, предсказуемую юнит-экономику на масштабе и независимость от изменений политики внешнего вендора. Чувствительность и объём данных обычно решают спор быстрее, чем чистое моделирование стоимости.

5

Как вы выбираете между файнтюнингом, retrieval-augmented generation (RAG) и одним лишь промпт-инжинирингом?

Ответ

Начинают с промптинга — он дешевле всего в итерациях и часто закрывает 80% задачи, если проблема просто в лучших инструкциях или примерах. За RAG идут, когда модели нужны факты, на которых её не обучали или которые часто меняются: ретрив держит знания актуальными без переобучения и позволяет цитировать источники. Файнтюнинг нужен, чтобы привить устойчивый стиль, формат или специализированный навык, с которым базовая модель ошибается даже при хорошем промпте и контексте, — и это самый дорогой вариант в итерациях, потому что каждое изменение означает новый прогон обучения и оценку. Большинство продакшн-систем в итоге комбинируют RAG для фактов с слегка дообученной моделью для тона и формата, а не выбирают что-то одно.

🦎

Прочитать ответы недостаточно

На собеседовании ты говоришь вслух под давлением. Кем задаст эти же вопросы, оценит каждый ответ и покажет, что именно подтянуть.

Пройти интервью Senior AI/ML Engineer →
Бесплатно · 3 интервью в месяц

Другие уровни — AI/ML Engineer

Junior AI/ML EngineerMiddle AI/ML EngineerВсе вопросы AI/ML Engineer

Другие специализации

🔍Senior QA Manual🤖Senior QA AutomationSenior Java Backend🐍Senior Python Backend🐘Senior PHP Backend🦫Senior Go Backend🟢Senior Node.js Backend💎Senior Ruby on Rails🟣Senior .NET Backend Developer🔷Senior C++