Data scientist-intervjufrågor, per rond
Av Aaron Cao · Uppdaterad

Data scientist-intervjuer täcker SQL och Python, statistik och sannolikhetslära, experimentdesign och A/B-testning, ett modellerings- eller metrikcase, samt beteendefrågor. Experimentronden är den som oftast avgör utfallet, eftersom det är den kandidater förbereder sig minst för.
Vilka ronder ingår i en data scientist-intervju?
Du har förmodligen förberett SQL och lite maskininlärning, men är osäker på vad mer som väntar. Det här avsnittet kartlägger de fem ronder som dessa intervjuer återanvänder, så att din förberedelse matchar bedömningen. Varje rond testar något annat, och att bara förbereda de två tekniska ronderna är det vanligaste sättet starka kandidater förlorar erbjudanden på.
- SQL och kodning. Att skriva queries plus datamanipulation i Python, oftast live.
- Statistik och sannolikhet. Tolkning och resonemang, inte bevis.
- Experimentdesign. A/B-tester: vad du mäter, hur länge du kör, när du kan lita på resultatet.
- Modellering eller case. Ett öppet problem du ramar in och sedan löser på en övergripande nivå.
- Beteende och intressenter. Hur du hanterat osäkerhet, oenighet och resultat ingen ville ha.
Titlar varierar. Ett företag som kallar rollen data scientist kan köra en analytikerintervju, och tvärtom. Om du vill ha analytikerversionen av den här sidan finns den i hubben intervjufrågor per roll.
Vilka statistik- och experimentfrågor förekommer?
Statistik och sannolikhet
- Vad betyder ett p-värde egentligen, och vad betyder det inte?
- Förklara ett konfidensintervall för en produktchef på två meningar.
- När skulle du använda ett t-test istället för ett z-test?
- Vad är centrala gränsvärdessatsen och varför spelar den roll för ditt arbete?
- En metrik har rört sig och resultatet är signifikant. Varför kan det ändå vara fel?
- Förklara typ I- och typ II-fel med hjälp av ett beslut ditt team faktiskt fattar.
- Vad är selektionsbias och hur skulle du upptäcka det i din data?
- När är en median en bättre sammanfattning än ett medelvärde?
Experimentdesign och A/B-testning
- Hur skulle du designa ett experiment för att testa ett nytt onboarding-flöde?
- Hur väljer du urvalsstorlek, och vad händer om du inte kan nå den?
- Ditt test är signifikant efter tre dagar. Släpper du det?
- Vad är en novelty-effekt, och hur skulle du skilja den från en verklig ökning?
- Hur hanterar du flera metriker som rör sig i olika riktningar?
- Vad skulle du göra om randomiseringen gick sönder mitt i testet?
- Hur skulle du mäta något du inte kan randomisera, som en prisändring över en hel marknad?
Mönstret att lägga märke till: nästan inget av detta har ett enda korrekt svar. De bedöms på om du namnger antagandet, anger avvägningen och säger vad du skulle kontrollera.
Vilka modellerings-, SQL- och produktfrågor förekommer?
Modellering
- Hur skulle du bygga en modell för att förutsäga kundbortfall (churn)? Börja med hur du skulle definiera churn.
- Din modell har 95 procents träffsäkerhet på ett obalanserat dataset. Är det bra?
- Förklara bias-variance-avvägningen med hjälp av en modell du har lanserat.
- Hur skulle du välja mellan en enkel och en komplex modell för det här problemet?
- Hur vet du att en modell har slutat fungera efter driftsättning?
- Förklara regularisering för någon som aldrig använt det.
SQL och Python
- Skriv en query som returnerar varje användares första och senaste köpdatum.
- Beräkna ett sju dagars rullande medelvärde för dagligen aktiva användare.
- Hitta konverteringsgraden per kohortmånad.
- Omforma i
pandasen lång tabell till en bred, och förklara när du inte skulle göra det. - Hur skulle du hitta och hantera dubblettrader i en transaktionstabell?
Produktkänsla och metriker
- Hur skulle du mäta om en ny funktion är framgångsrik?
- Dagligen aktiva användare ökar men intäkterna är oförändrade. Undersök.
- Vilken enskild metrik skulle du sätta på ledningens dashboard, och vilken skulle du utelämna?
- Hur skulle du skilja en bra retentionskurva från en dålig?
Hur bör du öva på dessa?
Att läsa en frågelista bygger igenkänning. Intervjuer testar produktion under tidspress med någon som avbryter dig, och det är andra färdigheter. Klyftan syns mest i experiment- och case-ronderna, där svaret är ett strukturerat argument snarare än ett faktum.
- Svara högt, med timer. Sex minuter per case-fråga, inga anteckningar, ingen omstart.
- Säg dina antaganden först. Att namnge vad du antar bedöms, och det köper dig också tänketid.
- Öva på att bli avbruten. Riktiga intervjuare bryter in vid minut två. Att repetera en oavbruten monolog förbereder dig inte för det.
- Skriv SQL för hand. Live-ronder använder ofta en vanlig editor utan autokomplettering och utan sätt att köra queryn.
- Förklara varje resultat två gånger. En gång tekniskt, en gång för en intressent som inte bryr sig om din metod.
En data scientist med fyra års erfarenhet förberedde sig för en marketplace-intervju genom att gå igenom hundra frågor i ett dokument, men låste sig på "ditt test är signifikant efter tre dagar, släpper du det" eftersom hon aldrig hade sagt ett svar högt. Innehållet fanns i hennes huvud; framförandet gjorde det inte. Om du vill öva på dessa med följdfrågor kör läget mock interview ronden och ifrågasätter dina svar.
FAQ
Hur mycket SQL behöver jag för en data scientist-intervju?
Vad är skillnaden mellan frågor för data scientist och data analyst?
Behöver jag djup maskininlärningskunskap för varje data scientist-roll?
Vad är den vanligaste anledningen till att kandidater misslyckas i dessa intervjuer?
Hur övar jag på dessa frågor utan en partner?
Relaterade frågor
- Vilka frågor ställs i en intervju för data engineer?
- Vilka frågor ställs i en intervju för data analyst?
- Vilka frågor ställs i en intervju för produktchefer?
- Vilka frågor om Copilot och AI-kodassistenter får utvecklare på intervjuer?
- Vilka frågor ställs i en andra intervju?
- Vilka frågor ställs i en AI-intervju?