Питання на співбесіді data scientist за раундами
Автор: Aaron Cao · Оновлено

Співбесіди data scientist охоплюють SQL і Python, статистику й теорію ймовірностей, дизайн експериментів та A/B-тестування, кейс з моделювання чи метрик, а також поведінкові питання. Раунд з експериментів найчастіше вирішує результат, бо саме до нього кандидати готуються найменше.
Які раунди містить співбесіда data scientist?
Ви, ймовірно, підготували SQL і трохи machine learning, але не впевнені, що ще на вас чекає. Цей розділ показує п'ять раундів, які повторюються в таких співбесідах, щоб підготовка відповідала критеріям оцінювання. Кожен раунд перевіряє щось інше, і підготовка лише двох технічних — найпоширеніший спосіб, яким сильні кандидати втрачають офери.
- SQL і кодування. Написання запитів плюс обробка даних на Python, зазвичай наживо.
- Статистика й теорія ймовірностей. Інтерпретація та міркування, а не доведення.
- Дизайн експериментів. A/B-тести: що вимірювати, як довго проводити, коли довіряти результату.
- Моделювання чи кейс. Відкрита задача, яку ви формулюєте, а потім розв'язуєте на високому рівні.
- Поведінкові питання та стейкхолдери. Як ви впоралися з невизначеністю, незгодою та результатами, яких ніхто не хотів.
Назви посад різняться. Компанія, яка називає цю роль data scientist, може проводити співбесіду аналітика, і навпаки. Якщо вам потрібна версія цієї сторінки для аналітика, вона є в хабі питань для співбесід за роллю.
Які питання зі статистики та експериментів трапляються?
Статистика й теорія ймовірностей
- Що насправді означає p-значення, а чого воно не означає?
- Поясніть довірчий інтервал продакт-менеджеру за два речення.
- Коли ви використали б t-тест замість z-тесту?
- Що таке центральна гранична теорема і чому вона важлива для вашої роботи?
- Метрика змінилася, і результат статистично значущий. Чому він все ще може бути хибним?
- Поясніть помилки I та II роду на прикладі рішення, яке справді ухвалює ваша команда.
- Що таке систематична помилка вибірки і як ви виявили б її у своїх даних?
- Коли медіана є кращим узагальненням, ніж середнє?
Дизайн експериментів та A/B-тестування
- Як ви спроєктували б експеримент для перевірки нового флоу онбордингу?
- Як ви обираєте розмір вибірки і що робите, якщо не можете його досягти?
- Ваш тест статистично значущий через три дні. Ви викочуєте його в продакшн?
- Що таке ефект новизни і як відокремити його від реального приросту?
- Як ви діяте, коли кілька метрик рухаються в різних напрямках?
- Що ви зробили б, якби рандомізація зламалася посеред тесту?
- Як виміряти те, що не можна рандомізувати, наприклад зміну цін на весь ринок?
Закономірність, яку варто помітити: майже жодне з цих питань не має єдиної правильної відповіді. Їх оцінюють за тим, чи назвали ви припущення, чи сформулювали компроміс і чи сказали, що б ви перевірили.
Які питання з моделювання, SQL і продукту трапляються?
Моделювання
- Як ви побудували б модель для прогнозування відтоку клієнтів? Почніть з того, як ви визначили б відтік.
- Ваша модель має точність 95 відсотків на незбалансованому датасеті. Це добре?
- Поясніть компроміс bias-variance на прикладі моделі, яку ви впровадили в продакшн.
- Як ви обрали б між простою і складною моделлю для цієї задачі?
- Як ви дізнаєтеся, що модель перестала працювати після деплою?
- Поясніть регуляризацію тому, хто ніколи її не використовував.
SQL і Python
- Напишіть запит, що повертає першу і останню дату покупки для кожного користувача.
- Обчисліть ковзне середнє за сім днів для щоденних активних користувачів.
- Знайдіть конверсію за місяцем когорти.
- У
pandasперетворіть довгу таблицю на широку і поясніть, коли ви цього не робили б. - Як ви знайшли б і обробили дублікати рядків у таблиці транзакцій?
Чуття продукту та метрики
- Як ви виміряли б, чи є нова функція успішною?
- Кількість щоденних активних користувачів зросла, а виручка стоїть на місці. Розберіться, чому.
- Яку одну метрику ви винесли б на дашборд для керівництва, а яку прибрали б?
- Як ви відрізнили б хорошу криву утримання від поганої?
Як це варто практикувати?
Читання списку питань формує впізнавання. Співбесіди перевіряють здатність видавати результат під тиском часу, коли хтось вас перебиває, а це зовсім інші навички. Розрив найпомітніший у раундах з експериментами та кейсами, де відповідь — це структурований аргумент, а не факт.
- Відповідайте вголос, на таймері. Шість хвилин на кейс-питання, без нотаток, без перезапусків.
- Спершу озвучте свої припущення. Те, що ви називаєте припущення, оцінюється, і це ще й дає вам час подумати.
- Тренуйтеся, коли вас перебивають. Реальні інтерв'юери втручаються на другій хвилині. Репетиція монологу без перебивань не готує вас до цього.
- Пишіть SQL від руки. На живих раундах часто використовують звичайний редактор без автодоповнення і без можливості виконати запит.
- Пояснюйте кожен результат двічі. Один раз технічно, інший раз — стейкхолдеру, якому байдуже до вашого методу.
Data scientist з чотирирічним досвідом готувалася до співбесіди в маркетплейсі, переглянувши сотню питань у документі, а потім розгубилася на питанні «ваш тест статистично значущий через три дні, ви викочуєте його в продакшн», бо жодного разу не проговорила відповідь вголос. Зміст був у неї в голові, а подача — ні. Якщо хочете відпрацювати це з уточнювальними питаннями, режим mock interview проводить раунд і тисне на ваші відповіді.
Часті запитання
Скільки SQL потрібно знати для співбесіди data scientist?
У чому різниця між питаннями для data scientist і data analyst?
Чи потрібна глибина machine learning для кожної ролі data scientist?
Яка найпоширеніша причина, через яку кандидати провалюють ці співбесіди?
Як практикувати ці питання без партнера?
Схожі запитання
- Які питання ставлять на співбесіді на Data Engineer?
- Які питання ставлять на співбесіді data analyst?
- Які питання ставлять на співбесіді для продакт-менеджера?
- Які питання про Copilot та ШІ-асистентів для коду ставлять розробникам на співбесідах?
- Які питання ставлять на другій співбесіді?
- Які питання ставлять на співбесіді зі ШІ?