P
prepair.app
Пройти интервью →
EnglishУкраїнськаРусскийDeutsch
⚙️

Senior DevOps / SREВопросы на собеседовании DevOps инженера

Senior · 5+ лет опыта

Собеседование DevOps и SRE — это не про перечисление инструментов, а про решения в условиях ограничений: что откатывать первым, на что ставить алерт и что сознательно оставить сломанным до утра. Ниже — вопросы, которые задают чаще всего, каждый с эталонным ответом. Senior: архитектуру, трейд-оффы, менторство и принятие решений.

Попробовать — без регистрации
Готовим вопрос…

Темы для подготовки

CI/CD пайплайны
Docker и контейнеры
Kubernetes
Terraform и IaC
Наблюдаемость и SLO
Инциденты и надёжность

6 вопросов уровня Senior с ответами

1

Как спроектировать откат, который действительно работает?

Ответ

Сделав каждый деплой обратимым независимо, а это в основном ограничивает базу: расширять до сужения, никогда не удалять в том же релизе, в котором перестали писать. Второе требование — откат должен использоваться: путь, который проходят раз в квартал во время инцидента, — это путь, который не работает. Фиче-флаги разводят релиз и деплой и превращают большинство откатов в правку конфигурации.

2

Идёт инцидент, причина неизвестна. Как вы его ведёте?

Ответ

Сначала восстановить сервис, диагностировать вторым: откат, перевод трафика или масштабирование не требуют знания первопричины. Кто-то владеет координацией и при этом сам не отлаживает, а хронология пишется по ходу, потому что память потом восстанавливает её неверно. Разбор спрашивает, что сделало отказ возможным и что сделало его долго незамеченным, а не кто набрал команду.

3

Как решать, на что ставить алерт?

Ответ

На симптомы, которые чувствует пользователь: доля ошибок, задержка, недоступность, — а не на причины, потому что причин много и большинство безвредны. У каждого алерта должно быть действие; тот, который регулярно подтверждают и игнорируют, обучает людей игнорировать алерты. Мера качества — сколько срабатываний были лишними, и это число надо регулярно смотреть.

4

Кластер стоит втрое дороже, чем должен. Куда смотреть?

Ответ

Сначала на requests против фактического потребления, потому что завышенные requests резервируют мощность, которой никто не пользуется, и это крупнейший источник потерь. Затем на размер узлов и упаковку, затем на то, что работает и никому не принадлежит: старые среды, забытые балансировщики, снапшоты. Хранилище и исходящий трафик — строки, которые растут тихо и никогда не попадают в первую оценку.

5

Как внедрять инфраструктуру как код в хозяйство, собранное руками?

Ответ

Импортируя, а не пересоздавая, по одному ограниченному куску, начиная с малорискового, чтобы процесс обкатался до того, как станет важен. Трудность не в инструменте, а в правиле, что ручные правки прекращаются: код, разошедшийся с реальностью, хуже отсутствия кода — ему доверяют, и он неверен. Проверку расхождений надо запускать по расписанию.

6

Как сделать дежурства выносимыми?

Ответ

Относясь к количеству срабатываний как к числу дефектов с владельцем, а не как к погоде. Ротация, которая будит по ночам, выжигает людей, и текучка обходится дороже инженерного времени на устранение причин. Конкретные практики: задача-последствие с каждого срабатывания, потолок допустимой рутины и время в следующем спринте, зарезервированное под то, что вскрыло прошлое дежурство.

🦎

Прочитать ответы недостаточно

На собеседовании ты говоришь вслух под давлением. Кем задаст эти же вопросы, оценит каждый ответ и покажет, что именно подтянуть.

Пройти интервью Senior DevOps / SRE →
Бесплатно · 3 интервью в месяц

Другие уровни — DevOps / SRE

Junior DevOps / SREMiddle DevOps / SREВсе вопросы DevOps / SRE

Другие специализации

🔍Senior QA Manual🤖Senior QA AutomationSenior Java Backend🐍Senior Python Backend🐘Senior PHP Backend🦫Senior Go Backend🟢Senior Node.js Backend💎Senior Ruby on Rails🟣Senior .NET Backend Developer🔷Senior C++