Otázky na pohovoru pro Data Scientist podle kola

Autor: Aaron Cao · Aktualizováno

Otázky na pohovoru pro Data Scientist podle kola
Pohovory pro data scientist zahrnují SQL a Python, statistiku a pravděpodobnost, návrh experimentů a A/B testování, case z modelování nebo metrik a behaviorální otázky. Kolo experimentování nejčastěji rozhoduje o výsledku, protože je to kolo, na které se kandidáti připravují nejméně.

Pohovory pro data scientist zahrnují SQL a Python, statistiku a pravděpodobnost, návrh experimentů a A/B testování, case z modelování nebo metrik a behaviorální otázky. Kolo experimentování nejčastěji rozhoduje o výsledku, protože je to kolo, na které se kandidáti připravují nejméně.

Jaká kola obsahuje pohovor pro data scientist?

Pravděpodobně jste si připravili SQL a trochu strojového učení, ale nejste si jistí, co dalšího vás čeká. Tato sekce mapuje pět kol, která se v těchto pohovorech opakují, aby vaše příprava odpovídala tomu, jak se hodnotí. Každé kolo testuje něco jiného a příprava jen na dvě technická kola je nejčastější způsob, jak silní kandidáti přicházejí o nabídky.

  • SQL a programování. Psaní dotazů plus manipulace s daty v Pythonu, obvykle naživo.
  • Statistika a pravděpodobnost. Interpretace a úsudek, ne důkazy.
  • Návrh experimentů. A/B testy: co měřit, jak dlouho je pouštět, kdy věřit výsledku.
  • Modelování nebo case. Otevřený problém, který zarámujete a poté vyřešíte na obecné úrovni.
  • Behaviorální a stakeholdeři. Jak jste zvládli nejednoznačnost, neshodu a výsledky, které nikdo nechtěl.

Názvy pozic se liší. Firma, která roli nazývá data scientist, může vést pohovor jako pro analytika, a naopak. Pokud chcete verzi této stránky pro analytiky, najdete ji v centru otázek na pohovor podle role.

Jaké otázky ze statistiky a experimentování se objevují?

Statistika a pravděpodobnost

  • Co vlastně znamená p-hodnota a co neznamená?
  • Vysvětlete interval spolehlivosti product manažerovi ve dvou větách.
  • Kdy byste použili t-test místo z-testu?
  • Co je centrální limitní věta a proč je důležitá pro vaši práci?
  • Metrika se pohnula a výsledek je statisticky významný. Proč by přesto mohl být špatně?
  • Vysvětlete chybu I. a II. druhu na rozhodnutí, které váš tým skutečně dělá.
  • Co je výběrové zkreslení a jak byste ho odhalili ve svých datech?
  • Kdy je medián lepším souhrnem než průměr?

Návrh experimentů a A/B testování

  • Jak byste navrhli experiment k otestování nového onboarding flow?
  • Jak volíte velikost vzorku a co se stane, když ji nemůžete dosáhnout?
  • Váš test je po třech dnech statisticky významný. Nasadíte ho?
  • Co je novelty effect a jak byste ho oddělili od skutečného nárůstu?
  • Jak řešíte, když se více metrik pohybuje různými směry?
  • Co byste udělali, kdyby se randomizace pokazila v polovině testu?
  • Jak byste měřili něco, co nelze randomizovat, například cenovou změnu na celém trhu?

Vzorec, kterého si všimněte: téměř žádná z těchto otázek nemá jedinou správnou odpověď. Hodnotí se podle toho, zda pojmenujete předpoklad, uvedete kompromis a řeknete, co byste ověřili.

Jaké otázky z modelování, SQL a produktu se objevují?

Modelování

  • Jak byste postavili model pro předpověď odchodu zákazníků (churn)? Začněte tím, jak byste churn definovali.
  • Váš model má přesnost 95 procent na nevyváženém datasetu. Je to dobré?
  • Vysvětlete kompromis mezi zkreslením a rozptylem (bias-variance) na modelu, který jste nasadili.
  • Jak byste se rozhodli mezi jednoduchým a složitým modelem pro tento problém?
  • Jak poznáte, že model po nasazení přestal fungovat?
  • Vysvětlete regularizaci někomu, kdo ji nikdy nepoužil.

SQL a Python

  • Napište dotaz, který vrátí první a nejnovější datum nákupu pro každého uživatele.
  • Vypočítejte klouzavý průměr za sedm dní pro denně aktivní uživatele.
  • Najděte konverzní poměr podle měsíce kohorty.
  • V pandas převeďte dlouhou tabulku na širokou a vysvětlete, kdy byste to neudělali.
  • Jak byste našli a ošetřili duplicitní řádky v tabulce transakcí?

Product sense a metriky

  • Jak byste měřili, zda je nová funkce úspěšná?
  • Denně aktivní uživatelé rostou, ale tržby stagnují. Prošetřete to.
  • Kterou jedinou metriku byste dali na dashboard vedení a kterou byste vynechali?
  • Jak byste odlišili dobrou retenční křivku od špatné?

Jak byste je měli trénovat?

Čtení seznamu otázek buduje rozpoznání. Pohovory testují výkon pod časovým tlakem, kdy vás někdo přerušuje, a to jsou jiné dovednosti. Rozdíl se nejvíc projeví v kolech experimentů a case, kde je odpověď strukturovaný argument, ne fakt.

  • Odpovídejte nahlas, na čas. Šest minut na case otázku, žádné poznámky, žádné restarty.
  • Nejdřív řekněte své předpoklady. To, že pojmenujete, co předpokládáte, se hodnotí a navíc vám to koupí čas na přemýšlení.
  • Trénujte, že vás budou přerušovat. Skuteční tazatelé skáčou do řeči ve druhé minutě. Nácvik nepřerušeného monologu vás na to nepřipraví.
  • Pište SQL ručně. Živá kola často používají obyčejný editor bez automatického doplňování a bez možnosti dotaz spustit.
  • Vysvětlete každý výsledek dvakrát. Jednou technicky, jednou pro stakeholdera, kterému nezáleží na vaší metodě.

Data scientist se čtyřmi lety zkušeností se připravovala na pohovor v marketplace tak, že si v dokumentu prošla sto otázek, a pak zamrzla na otázce „váš test je po třech dnech statisticky významný, nasadíte ho", protože na ni nikdy neřekla odpověď nahlas. Obsah měla v hlavě, podání ne. Pokud je chcete trénovat s doplňujícími otázkami, režim mock interview vede kolo a zpochybňuje vaše odpovědi.

Časté dotazy

Kolik SQL potřebuji na pohovor pro data scientist?

Dost na to, abyste plynule psali joiny, okenní funkce a agregace bez dokumentace. SQL je spíš filtr než odlišující faktor: jeho zvládnutí se očekává a žádné další zdokonalování SQL nevykompenzuje slabé kolo experimentování.

Jaký je rozdíl mezi otázkami pro data scientist a data analyst?

Pohovory pro analytika se soustředí na SQL a business case. Pohovory pro data scientist přidávají návrh experimentů a modelování a posouvají statistiku od interpretace k rozhodnutím o návrhu. Kola behaviorální a se stakeholdery jsou téměř identická.

Potřebuji hloubku strojového učení pro každou roli data scientist?

Ne. Produktové role data scientist často kladou mnohem větší důraz na experimentování a metriky než na modelování, zatímco výzkumné nebo platformní role to obrací. Zeptejte se recruitera, jaká kola máte naplánovaná, než se rozhodnete, co studovat.

Jaký je nejčastější důvod, proč kandidáti u těchto pohovorů neuspějí?

Odpovídání na otázky o experimentech a case jako na fakta, ne jako na argumenty. Tazatelé hodnotí, zda jste pojmenovali předpoklad, záměrně zvolili metriku a řekli, co byste ověřili, ne zda jste dospěli k jejich preferovanému závěru.

Jak trénovat tyto otázky bez partnera?

Odpovídejte nahlas na čas a nahrávejte se, pak zkontrolujte, zda jste uvedli předpoklady a strukturu. AI mock interviewer také dokáže vést kolo a přerušovat doplňujícími otázkami, což je blíž reálnému tlaku než čtení seznamu.

Související otázky

← Více o Otázky k pohovoru podle role a tématu