Вопросы на интервью data scientist по раундам

Автор: Aaron Cao · Обновлено

Вопросы на интервью data scientist по раундам
Собеседования data scientist охватывают SQL и Python, статистику и теорию вероятностей, дизайн экспериментов и A/B-тестирование, кейс по моделированию или метрикам, а также поведенческие вопросы. Раунд с экспериментами чаще всего решает исход, потому что именно к нему кандидаты готовятся меньше всего.

Собеседования data scientist охватывают SQL и Python, статистику и теорию вероятностей, дизайн экспериментов и A/B-тестирование, кейс по моделированию или метрикам, а также поведенческие вопросы. Раунд с экспериментами чаще всего решает исход, потому что именно к нему кандидаты готовятся меньше всего.

Из каких раундов состоит интервью data scientist?

Вы, вероятно, уже подготовили SQL и немного machine learning, но не уверены, что будет дальше. Этот раздел описывает пять раундов, которые повторяются в таких процессах, чтобы ваша подготовка соответствовала оценке. Каждый раунд проверяет что-то своё, и подготовка только двух технических раундов — самая частая причина, по которой сильные кандидаты теряют офферы.

  • SQL и код. Написание запросов плюс обработка данных на Python, обычно вживую.
  • Статистика и вероятность. Интерпретация и рассуждение, а не доказательства.
  • Дизайн экспериментов. A/B-тесты: что измерять, сколько времени запускать, когда доверять результату.
  • Моделирование или кейс. Открытая задача, которую вы формулируете и решаете на высоком уровне.
  • Поведенческий раунд и стейкхолдеры. Как вы справлялись с неопределённостью, разногласиями и нежелательными результатами.

Названия различаются. Компания, которая называет роль data scientist, может на деле проводить процесс для analyst, и наоборот. Если вам нужна версия этой страницы для analyst, она находится в хабе вопросов на собеседовании по ролям.

Какие вопросы по статистике и экспериментам встречаются?

Статистика и вероятность

  • Что на самом деле означает p-value, а что не означает?
  • Объясните доверительный интервал продакт-менеджеру в двух предложениях.
  • Когда вы использовали бы t-тест вместо z-теста?
  • Что такое центральная предельная теорема и почему она важна для вашей работы?
  • Метрика изменилась, и результат статистически значим. Почему он всё же может быть неверным?
  • Объясните ошибки первого и второго рода на примере реального решения вашей команды.
  • Что такое selection bias и как вы обнаружили бы его в своих данных?
  • Когда медиана — лучшая сводная характеристика, чем среднее?

Дизайн экспериментов и A/B-тесты

  • Как бы вы спроектировали эксперимент для проверки нового onboarding-флоу?
  • Как вы выбираете размер выборки, и что происходит, если его не удаётся набрать?
  • Ваш тест стал значимым через три дня. Вы выкатываете его?
  • Что такое эффект новизны, и как вы отделили бы его от реального прироста?
  • Как вы поступаете, когда несколько метрик движутся в разные стороны?
  • Что бы вы сделали, если рандомизация сломалась посреди теста?
  • Как бы вы измерили то, что нельзя рандомизировать, например изменение цены на весь рынок?

Закономерность, на которую стоит обратить внимание: почти ни у одного из этих вопросов нет единственного правильного ответа. Их оценивают по тому, называете ли вы допущение, формулируете ли компромисс и говорите ли, что бы вы проверили.

Какие вопросы по моделированию, SQL и продукту встречаются?

Моделирование

  • Как бы вы построили модель для прогнозирования customer churn? Начните с того, как вы определили бы churn.
  • Ваша модель показывает 95 процентов accuracy на несбалансированном датасете. Это хорошо?
  • Объясните компромисс bias-variance на примере модели, которую вы выкатывали в продакшен.
  • Как бы вы выбирали между простой и сложной моделью для этой задачи?
  • Как вы узнаёте, что модель перестала работать после деплоя?
  • Объясните регуляризацию тому, кто никогда её не использовал.

SQL и Python

  • Напишите запрос, возвращающий дату первой и последней покупки каждого пользователя.
  • Вычислите скользящее среднее за семь дней для ежедневных активных пользователей.
  • Найдите конверсию по месяцу когорты.
  • В pandas преобразуйте длинную таблицу в широкую и объясните, когда вы бы этого не делали.
  • Как бы вы находили и обрабатывали дублирующиеся строки в таблице транзакций?

Product sense и метрики

  • Как бы вы измеряли успешность новой фичи?
  • Ежедневные активные пользователи растут, а выручка не меняется. Разберитесь, в чём дело.
  • Какую одну метрику вы бы вынесли на дашборд руководства, а какую убрали бы?
  • Как отличить хорошую кривую retention от плохой?

Как тренировать эти вопросы?

Чтение списка вопросов даёт узнавание. Собеседования проверяют работу под давлением времени, пока вас перебивают, а это другие навыки. Разрыв сильнее всего проявляется в раундах с экспериментами и кейсами, где ответ — это структурированный аргумент, а не факт.

  • Отвечайте вслух, с таймером. Шесть минут на кейс-вопрос, без записей, без перезапуска.
  • Сначала называйте свои допущения. То, что вы называете свои допущения, оценивается, и это ещё даёт время подумать.
  • Тренируйтесь, чтобы вас перебивали. Настоящие интервьюеры вмешиваются уже на второй минуте. Репетиция монолога без перебиваний не готовит вас к этому.
  • Пишите SQL от руки. На живых раундах часто используют простой редактор без автодополнения и без возможности запустить запрос.
  • Объясняйте каждый результат дважды. Один раз технически, другой раз — для стейкхолдера, которому не важен ваш метод.

Data scientist с четырёхлетним опытом готовилась к собеседованию в marketplace-компанию, просматривая сто вопросов в документе, а потом застряла на вопросе "ваш тест стал значимым через три дня, вы выкатываете его?", потому что никогда не проговаривала ответ на него вслух. Содержание было у неё в голове; подача — нет. Если хотите отрабатывать это с уточняющими вопросами, режим mock interview проводит раунд и оспаривает ваши ответы.

Частые вопросы

Сколько SQL мне нужно знать для собеседования data scientist?

Достаточно, чтобы свободно писать joins, оконные функции и агрегации без документации. SQL — скорее фильтр, чем отличительная черта: пройти его — это ожидание, и никакая дополнительная полировка SQL не компенсирует слабый раунд с экспериментами.

В чём разница между вопросами для data scientist и data analyst?

Собеседования для analyst сосредоточены на SQL и бизнес-кейсах. У data scientist добавляются дизайн экспериментов и моделирование, а статистика переходит от интерпретации к решениям о дизайне. Поведенческий раунд и раунд со стейкхолдерами почти идентичны.

Нужна ли глубина в machine learning для каждой роли data scientist?

Нет. В ролях product data scientist экспериментам и метрикам часто уделяют намного больше веса, чем моделированию, а в ролях research или platform — наоборот. Спросите рекрутера, какие раунды у вас запланированы, прежде чем решать, что учить.

Какая самая частая причина, по которой кандидаты проваливают эти собеседования?

Отвечать на вопросы про эксперименты и кейсы как на факты, а не как на аргументы. Интервьюеры оценивают, назвали ли вы допущение, осознанно ли выбрали метрику и сказали ли, что бы проверили, а не то, пришли ли вы к их предпочтительному выводу.

Как тренировать эти вопросы без партнёра?

Отвечайте вслух с таймером и записывайте себя, а затем проверяйте, назвали ли вы допущения и структуру. AI-интервьюер для mock interview тоже может проводить раунд и перебивать уточняющими вопросами, что ближе к реальному давлению, чем чтение списка.

Похожие вопросы

← Подробнее: Вопросы на собеседовании по роли и теме