Питання на співбесіді data scientist за раундами

Автор: Aaron Cao · Оновлено

Питання на співбесіді data scientist за раундами
Співбесіди data scientist охоплюють SQL і Python, статистику й теорію ймовірностей, дизайн експериментів та A/B-тестування, кейс з моделювання чи метрик, а також поведінкові питання. Раунд з експериментів найчастіше вирішує результат, бо саме до нього кандидати готуються найменше.

Співбесіди data scientist охоплюють SQL і Python, статистику й теорію ймовірностей, дизайн експериментів та A/B-тестування, кейс з моделювання чи метрик, а також поведінкові питання. Раунд з експериментів найчастіше вирішує результат, бо саме до нього кандидати готуються найменше.

Які раунди містить співбесіда data scientist?

Ви, ймовірно, підготували SQL і трохи machine learning, але не впевнені, що ще на вас чекає. Цей розділ показує п'ять раундів, які повторюються в таких співбесідах, щоб підготовка відповідала критеріям оцінювання. Кожен раунд перевіряє щось інше, і підготовка лише двох технічних — найпоширеніший спосіб, яким сильні кандидати втрачають офери.

  • SQL і кодування. Написання запитів плюс обробка даних на Python, зазвичай наживо.
  • Статистика й теорія ймовірностей. Інтерпретація та міркування, а не доведення.
  • Дизайн експериментів. A/B-тести: що вимірювати, як довго проводити, коли довіряти результату.
  • Моделювання чи кейс. Відкрита задача, яку ви формулюєте, а потім розв'язуєте на високому рівні.
  • Поведінкові питання та стейкхолдери. Як ви впоралися з невизначеністю, незгодою та результатами, яких ніхто не хотів.

Назви посад різняться. Компанія, яка називає цю роль data scientist, може проводити співбесіду аналітика, і навпаки. Якщо вам потрібна версія цієї сторінки для аналітика, вона є в хабі питань для співбесід за роллю.

Які питання зі статистики та експериментів трапляються?

Статистика й теорія ймовірностей

  • Що насправді означає p-значення, а чого воно не означає?
  • Поясніть довірчий інтервал продакт-менеджеру за два речення.
  • Коли ви використали б t-тест замість z-тесту?
  • Що таке центральна гранична теорема і чому вона важлива для вашої роботи?
  • Метрика змінилася, і результат статистично значущий. Чому він все ще може бути хибним?
  • Поясніть помилки I та II роду на прикладі рішення, яке справді ухвалює ваша команда.
  • Що таке систематична помилка вибірки і як ви виявили б її у своїх даних?
  • Коли медіана є кращим узагальненням, ніж середнє?

Дизайн експериментів та A/B-тестування

  • Як ви спроєктували б експеримент для перевірки нового флоу онбордингу?
  • Як ви обираєте розмір вибірки і що робите, якщо не можете його досягти?
  • Ваш тест статистично значущий через три дні. Ви викочуєте його в продакшн?
  • Що таке ефект новизни і як відокремити його від реального приросту?
  • Як ви діяте, коли кілька метрик рухаються в різних напрямках?
  • Що ви зробили б, якби рандомізація зламалася посеред тесту?
  • Як виміряти те, що не можна рандомізувати, наприклад зміну цін на весь ринок?

Закономірність, яку варто помітити: майже жодне з цих питань не має єдиної правильної відповіді. Їх оцінюють за тим, чи назвали ви припущення, чи сформулювали компроміс і чи сказали, що б ви перевірили.

Які питання з моделювання, SQL і продукту трапляються?

Моделювання

  • Як ви побудували б модель для прогнозування відтоку клієнтів? Почніть з того, як ви визначили б відтік.
  • Ваша модель має точність 95 відсотків на незбалансованому датасеті. Це добре?
  • Поясніть компроміс bias-variance на прикладі моделі, яку ви впровадили в продакшн.
  • Як ви обрали б між простою і складною моделлю для цієї задачі?
  • Як ви дізнаєтеся, що модель перестала працювати після деплою?
  • Поясніть регуляризацію тому, хто ніколи її не використовував.

SQL і Python

  • Напишіть запит, що повертає першу і останню дату покупки для кожного користувача.
  • Обчисліть ковзне середнє за сім днів для щоденних активних користувачів.
  • Знайдіть конверсію за місяцем когорти.
  • У pandas перетворіть довгу таблицю на широку і поясніть, коли ви цього не робили б.
  • Як ви знайшли б і обробили дублікати рядків у таблиці транзакцій?

Чуття продукту та метрики

  • Як ви виміряли б, чи є нова функція успішною?
  • Кількість щоденних активних користувачів зросла, а виручка стоїть на місці. Розберіться, чому.
  • Яку одну метрику ви винесли б на дашборд для керівництва, а яку прибрали б?
  • Як ви відрізнили б хорошу криву утримання від поганої?

Як це варто практикувати?

Читання списку питань формує впізнавання. Співбесіди перевіряють здатність видавати результат під тиском часу, коли хтось вас перебиває, а це зовсім інші навички. Розрив найпомітніший у раундах з експериментами та кейсами, де відповідь — це структурований аргумент, а не факт.

  • Відповідайте вголос, на таймері. Шість хвилин на кейс-питання, без нотаток, без перезапусків.
  • Спершу озвучте свої припущення. Те, що ви називаєте припущення, оцінюється, і це ще й дає вам час подумати.
  • Тренуйтеся, коли вас перебивають. Реальні інтерв'юери втручаються на другій хвилині. Репетиція монологу без перебивань не готує вас до цього.
  • Пишіть SQL від руки. На живих раундах часто використовують звичайний редактор без автодоповнення і без можливості виконати запит.
  • Пояснюйте кожен результат двічі. Один раз технічно, інший раз — стейкхолдеру, якому байдуже до вашого методу.

Data scientist з чотирирічним досвідом готувалася до співбесіди в маркетплейсі, переглянувши сотню питань у документі, а потім розгубилася на питанні «ваш тест статистично значущий через три дні, ви викочуєте його в продакшн», бо жодного разу не проговорила відповідь вголос. Зміст був у неї в голові, а подача — ні. Якщо хочете відпрацювати це з уточнювальними питаннями, режим mock interview проводить раунд і тисне на ваші відповіді.

Часті запитання

Скільки SQL потрібно знати для співбесіди data scientist?

Достатньо, щоб вільно писати join'и, віконні функції та агрегації без документації. SQL — це фільтр, а не диференціатор: його проходження очікується, і жодна додаткова відточеність SQL не компенсує слабкий раунд з експериментів.

У чому різниця між питаннями для data scientist і data analyst?

Співбесіди аналітика зосереджені на SQL і бізнес-кейсах. Співбесіди data scientist додають дизайн експериментів і моделювання, а статистику переводять з інтерпретації в рішення щодо дизайну. Раунди поведінкових питань і стейкхолдерів практично ідентичні.

Чи потрібна глибина machine learning для кожної ролі data scientist?

Ні. Продуктові ролі data scientist часто цінують експерименти й метрики набагато більше, ніж моделювання, тоді як дослідницькі чи платформні ролі — навпаки. Запитайте рекрутера, які раунди у вас заплановані, перш ніж обирати, що вчити.

Яка найпоширеніша причина, через яку кандидати провалюють ці співбесіди?

Відповіді на питання про експерименти й кейси як на факти, а не як на аргументи. Інтерв'юери оцінюють, чи назвали ви припущення, чи свідомо обрали метрику і чи сказали, що б перевірили, а не чи дійшли ви до їхнього бажаного висновку.

Як практикувати ці питання без партнера?

Відповідайте вголос на таймері і записуйте себе, а потім перевіряйте, чи озвучили ви припущення та структуру. AI-інтерв'юер для тренувальних співбесід також може провести раунд і перебивати уточнювальними питаннями, що ближче до реального тиску, ніж читання списку.

Схожі запитання

← Докладніше: Питання для співбесід за роллю та темою