Otázky na pohovoru pro Data Scientist podle kola
Autor: Aaron Cao · Aktualizováno

Pohovory pro data scientist zahrnují SQL a Python, statistiku a pravděpodobnost, návrh experimentů a A/B testování, case z modelování nebo metrik a behaviorální otázky. Kolo experimentování nejčastěji rozhoduje o výsledku, protože je to kolo, na které se kandidáti připravují nejméně.
Jaká kola obsahuje pohovor pro data scientist?
Pravděpodobně jste si připravili SQL a trochu strojového učení, ale nejste si jistí, co dalšího vás čeká. Tato sekce mapuje pět kol, která se v těchto pohovorech opakují, aby vaše příprava odpovídala tomu, jak se hodnotí. Každé kolo testuje něco jiného a příprava jen na dvě technická kola je nejčastější způsob, jak silní kandidáti přicházejí o nabídky.
- SQL a programování. Psaní dotazů plus manipulace s daty v Pythonu, obvykle naživo.
- Statistika a pravděpodobnost. Interpretace a úsudek, ne důkazy.
- Návrh experimentů. A/B testy: co měřit, jak dlouho je pouštět, kdy věřit výsledku.
- Modelování nebo case. Otevřený problém, který zarámujete a poté vyřešíte na obecné úrovni.
- Behaviorální a stakeholdeři. Jak jste zvládli nejednoznačnost, neshodu a výsledky, které nikdo nechtěl.
Názvy pozic se liší. Firma, která roli nazývá data scientist, může vést pohovor jako pro analytika, a naopak. Pokud chcete verzi této stránky pro analytiky, najdete ji v centru otázek na pohovor podle role.
Jaké otázky ze statistiky a experimentování se objevují?
Statistika a pravděpodobnost
- Co vlastně znamená p-hodnota a co neznamená?
- Vysvětlete interval spolehlivosti product manažerovi ve dvou větách.
- Kdy byste použili t-test místo z-testu?
- Co je centrální limitní věta a proč je důležitá pro vaši práci?
- Metrika se pohnula a výsledek je statisticky významný. Proč by přesto mohl být špatně?
- Vysvětlete chybu I. a II. druhu na rozhodnutí, které váš tým skutečně dělá.
- Co je výběrové zkreslení a jak byste ho odhalili ve svých datech?
- Kdy je medián lepším souhrnem než průměr?
Návrh experimentů a A/B testování
- Jak byste navrhli experiment k otestování nového onboarding flow?
- Jak volíte velikost vzorku a co se stane, když ji nemůžete dosáhnout?
- Váš test je po třech dnech statisticky významný. Nasadíte ho?
- Co je novelty effect a jak byste ho oddělili od skutečného nárůstu?
- Jak řešíte, když se více metrik pohybuje různými směry?
- Co byste udělali, kdyby se randomizace pokazila v polovině testu?
- Jak byste měřili něco, co nelze randomizovat, například cenovou změnu na celém trhu?
Vzorec, kterého si všimněte: téměř žádná z těchto otázek nemá jedinou správnou odpověď. Hodnotí se podle toho, zda pojmenujete předpoklad, uvedete kompromis a řeknete, co byste ověřili.
Jaké otázky z modelování, SQL a produktu se objevují?
Modelování
- Jak byste postavili model pro předpověď odchodu zákazníků (churn)? Začněte tím, jak byste churn definovali.
- Váš model má přesnost 95 procent na nevyváženém datasetu. Je to dobré?
- Vysvětlete kompromis mezi zkreslením a rozptylem (bias-variance) na modelu, který jste nasadili.
- Jak byste se rozhodli mezi jednoduchým a složitým modelem pro tento problém?
- Jak poznáte, že model po nasazení přestal fungovat?
- Vysvětlete regularizaci někomu, kdo ji nikdy nepoužil.
SQL a Python
- Napište dotaz, který vrátí první a nejnovější datum nákupu pro každého uživatele.
- Vypočítejte klouzavý průměr za sedm dní pro denně aktivní uživatele.
- Najděte konverzní poměr podle měsíce kohorty.
- V
pandaspřeveďte dlouhou tabulku na širokou a vysvětlete, kdy byste to neudělali. - Jak byste našli a ošetřili duplicitní řádky v tabulce transakcí?
Product sense a metriky
- Jak byste měřili, zda je nová funkce úspěšná?
- Denně aktivní uživatelé rostou, ale tržby stagnují. Prošetřete to.
- Kterou jedinou metriku byste dali na dashboard vedení a kterou byste vynechali?
- Jak byste odlišili dobrou retenční křivku od špatné?
Jak byste je měli trénovat?
Čtení seznamu otázek buduje rozpoznání. Pohovory testují výkon pod časovým tlakem, kdy vás někdo přerušuje, a to jsou jiné dovednosti. Rozdíl se nejvíc projeví v kolech experimentů a case, kde je odpověď strukturovaný argument, ne fakt.
- Odpovídejte nahlas, na čas. Šest minut na case otázku, žádné poznámky, žádné restarty.
- Nejdřív řekněte své předpoklady. To, že pojmenujete, co předpokládáte, se hodnotí a navíc vám to koupí čas na přemýšlení.
- Trénujte, že vás budou přerušovat. Skuteční tazatelé skáčou do řeči ve druhé minutě. Nácvik nepřerušeného monologu vás na to nepřipraví.
- Pište SQL ručně. Živá kola často používají obyčejný editor bez automatického doplňování a bez možnosti dotaz spustit.
- Vysvětlete každý výsledek dvakrát. Jednou technicky, jednou pro stakeholdera, kterému nezáleží na vaší metodě.
Data scientist se čtyřmi lety zkušeností se připravovala na pohovor v marketplace tak, že si v dokumentu prošla sto otázek, a pak zamrzla na otázce „váš test je po třech dnech statisticky významný, nasadíte ho", protože na ni nikdy neřekla odpověď nahlas. Obsah měla v hlavě, podání ne. Pokud je chcete trénovat s doplňujícími otázkami, režim mock interview vede kolo a zpochybňuje vaše odpovědi.
Časté dotazy
Kolik SQL potřebuji na pohovor pro data scientist?
Jaký je rozdíl mezi otázkami pro data scientist a data analyst?
Potřebuji hloubku strojového učení pro každou roli data scientist?
Jaký je nejčastější důvod, proč kandidáti u těchto pohovorů neuspějí?
Jak trénovat tyto otázky bez partnera?
Související otázky
- Jaké otázky se pokládají na pohovoru na data engineera?
- Jaké otázky se kladou na pohovoru pro data analytika?
- Jaké otázky se kladou na pohovoru na produktového manažera?
- Jaké otázky o Copilotu a asistentech pro psaní kódu dostávají vývojáři u pohovoru?
- Jaké otázky se kladou u druhého kola pohovoru?
- Jaké otázky se pokládají v pohovoru s AI?