Pytania na Rozmowie Data Scientist, wg Etapów

Autor: Aaron Cao · Zaktualizowano

Pytania na Rozmowie Data Scientist, wg Etapów
Rozmowy na data scientista obejmują SQL i Python, statystykę i prawdopodobieństwo, projektowanie eksperymentów i testy A/B, case modelowania lub metryk oraz pytania behawioralne. Eksperymentowanie to etap, który najczęściej decyduje o wyniku, ponieważ kandydaci przygotowują się do niego najsłabiej.

Rozmowy na data scientista obejmują SQL i Python, statystykę i prawdopodobieństwo, projektowanie eksperymentów i testy A/B, case modelowania lub metryk oraz pytania behawioralne. Eksperymentowanie to etap, który najczęściej decyduje o wyniku, ponieważ kandydaci przygotowują się do niego najsłabiej.

Jakie etapy zawiera rozmowa na data scientista?

Prawdopodobnie przygotowałeś SQL i trochę machine learningu, ale nie wiesz, co jeszcze cię czeka. Ta sekcja mapuje pięć etapów, które te rozmowy powtarzają, aby twoja nauka odpowiadała sposobowi oceniania. Każdy etap testuje coś innego, a przygotowanie tylko dwóch etapów technicznych to najczęstszy sposób, w jaki mocni kandydaci tracą oferty.

  • SQL i kodowanie. Pisanie zapytań plus manipulacja danymi w Pythonie, zwykle na żywo.
  • Statystyka i prawdopodobieństwo. Interpretacja i rozumowanie, nie dowody.
  • Projektowanie eksperymentów. Testy A/B: co mierzyć, jak długo je prowadzić, kiedy ufać wynikowi.
  • Modelowanie lub case. Otwarty problem, który sam ujmujesz, a następnie rozwiązujesz na wysokim poziomie ogólności.
  • Behawioralny i interesariusze. Jak radziłeś sobie z niejednoznacznością, niezgodą i wynikami, których nikt nie chciał.

Nazwy stanowisk się różnią. Firma, która nazywa stanowisko data scientist, może prowadzić rozmowę w stylu analityka, i odwrotnie. Jeśli szukasz wersji analitycznej tej strony, znajdziesz ją w centrum pytań rekrutacyjnych wg roli.

Jakie pytania ze statystyki i eksperymentów się pojawiają?

Statystyka i prawdopodobieństwo

  • Co tak naprawdę oznacza wartość p, a czego nie oznacza?
  • Wyjaśnij przedział ufności menedżerowi produktu w dwóch zdaniach.
  • Kiedy użyłbyś testu t zamiast testu z?
  • Czym jest centralne twierdzenie graniczne i dlaczego ma znaczenie dla twojej pracy?
  • Metryka się poruszyła, a wynik jest istotny statystycznie. Dlaczego mimo to może być błędny?
  • Wyjaśnij błąd typu I i typu II na przykładzie decyzji, którą naprawdę podejmuje twój zespół.
  • Czym jest bias selekcji i jak wykryłbyś go w swoich danych?
  • Kiedy mediana jest lepszym podsumowaniem niż średnia?

Projektowanie eksperymentów i testy A/B

  • Jak zaprojektowałbyś eksperyment, aby przetestować nowy proces onboardingu?
  • Jak wybierasz wielkość próby i co się dzieje, jeśli nie da się jej osiągnąć?
  • Twój test jest istotny statystycznie po trzech dniach. Wdrażasz go?
  • Czym jest efekt nowości i jak odróżniłbyś go od prawdziwego wzrostu?
  • Jak radzisz sobie z wieloma metrykami poruszającymi się w różnych kierunkach?
  • Co byś zrobił, gdyby randomizacja zepsuła się w połowie testu?
  • Jak zmierzyłbyś coś, czego nie możesz zrandomizować, na przykład zmianę ceny w całym rynku?

Wzorzec, który warto zauważyć: prawie żadne z tych pytań nie ma jednej poprawnej odpowiedzi. Są oceniane na podstawie tego, czy nazwiesz założenie, wskażesz kompromis i powiesz, co byś sprawdził.

Jakie pytania z modelowania, SQL i produktu się pojawiają?

Modelowanie

  • Jak zbudowałbyś model do przewidywania churnu klientów? Zacznij od zdefiniowania churnu.
  • Twój model ma 95 procent dokładności na niezbalansowanym zbiorze danych. Czy to dobrze?
  • Wyjaśnij kompromis bias-wariancja na przykładzie modelu, który wdrożyłeś.
  • Jak decydujesz między prostym a złożonym modelem dla tego problemu?
  • Skąd wiesz, że model przestał działać po wdrożeniu?
  • Wyjaśnij regularyzację komuś, kto nigdy jej nie używał.

SQL i Python

  • Napisz zapytanie zwracające pierwszą i najnowszą datę zakupu każdego użytkownika.
  • Oblicz siedmiodniową średnią kroczącą dziennych aktywnych użytkowników.
  • Znajdź współczynnik konwersji według miesiąca kohorty.
  • W pandas przekształć długą tabelę w szeroką i wyjaśnij, kiedy byś tego nie zrobił.
  • Jak znalazłbyś i obsłużył zduplikowane wiersze w tabeli transakcji?

Product sense i metryki

  • Jak zmierzyłbyś, czy nowa funkcja odniosła sukces?
  • Dzienni aktywni użytkownicy rosną, ale przychód jest płaski. Zbadaj to.
  • Którą jedną metrykę umieściłbyś na dashboardzie dla kierownictwa, a co byś pominął?
  • Jak odróżniłbyś dobrą krzywą retencji od złej?

Jak najlepiej ćwiczyć te pytania?

Czytanie listy pytań buduje rozpoznawanie. Rozmowy kwalifikacyjne testują wykonanie pod presją czasu, gdy ktoś ci przerywa, a to inne umiejętności. Ta luka ujawnia się najbardziej w etapach eksperymentu i case'u, gdzie odpowiedzią jest ustrukturyzowany argument, a nie fakt.

  • Odpowiadaj na głos, z zegarem. Sześć minut na pytanie case'owe, bez notatek, bez zaczynania od nowa.
  • Najpierw nazwij swoje założenia. Nazwanie tego, co zakładasz, jest oceniane, a dodatkowo daje ci czas na myślenie.
  • Ćwicz bycie przerywanym. Prawdziwi rekruterzy wtrącają się w drugiej minucie. Ćwiczenie nieprzerywanego monologu cię do tego nie przygotuje.
  • Pisz SQL ręcznie. Etapy na żywo często wykorzystują zwykły edytor bez autouzupełniania i bez możliwości uruchomienia zapytania.
  • Wyjaśnij każdy wynik dwukrotnie. Raz technicznie, raz interesariuszowi, którego nie obchodzi twoja metoda.

Data scientistka z czteroletnim doświadczeniem przygotowywała się do rozmowy w marketplace, przeglądając sto pytań w dokumencie, po czym zamarła na pytaniu "twój test jest istotny statystycznie po trzech dniach, wdrażasz go", bo nigdy nie powiedziała na nie odpowiedzi na głos. Treść była w jej głowie; przekaz nie. Jeśli chcesz przećwiczyć to z pytaniami dodatkowymi, tryb mock interview prowadzi ten etap i podważa twoje odpowiedzi.

FAQ

Ile SQL potrzebuję na rozmowę na data scientista?

Na tyle, by płynnie pisać joiny, funkcje okienkowe i agregacje bez dokumentacji. SQL to filtr, a nie wyróżnik: przejście go jest oczekiwane, a żadna ilość dodatkowego polerowania SQL nie zrekompensuje słabego etapu eksperymentalnego.

Jaka jest różnica między pytaniami dla data scientista a data analityka?

Rozmowy dla analityków koncentrują się na SQL i case'ach biznesowych. Rozmowy dla data scientistów dodają projektowanie eksperymentów i modelowanie, przesuwając statystykę od interpretacji do decyzji projektowych. Etapy behawioralne i z interesariuszami są niemal identyczne.

Czy potrzebuję głębokiej wiedzy z machine learningu na każde stanowisko data scientist?

Nie. Stanowiska product data scientist często ważą eksperymentowanie i metryki znacznie bardziej niż modelowanie, podczas gdy role badawcze lub platformowe odwracają tę proporcję. Zapytaj rekrutera, jakie etapy masz zaplanowane, zanim wybierzesz, czego się uczyć.

Jaki jest najczęstszy powód, dla którego kandydaci nie przechodzą tych rozmów?

Odpowiadanie na pytania eksperymentalne i case'owe jako na fakty, a nie jako na argumenty. Rekruterzy oceniają, czy nazwałeś założenie, świadomie wybrałeś metrykę i powiedziałeś, co byś sprawdził, a nie czy doszedłeś do wniosku, który preferowali.

Jak ćwiczyć te pytania bez partnera?

Odpowiadaj na głos z zegarem i nagrywaj się, a potem sprawdzaj, czy nazwałeś założenia i strukturę. Sztuczny mock interviewer AI może też poprowadzić ten etap i przerywać pytaniami dodatkowymi, co jest bliższe prawdziwej presji niż czytanie listy.

Powiązane pytania

← Więcej o Pytania rekrutacyjne według roli i tematu