Ερωτήσεις συνέντευξης Data Scientist, ανά γύρο

Από Aaron Cao · Ενημερώθηκε

Ερωτήσεις συνέντευξης Data Scientist, ανά γύρο
Οι συνεντεύξεις data scientist καλύπτουν SQL και Python, στατιστική και πιθανότητες, σχεδιασμό πειραμάτων και A/B testing, ένα case μοντελοποίησης ή μετρικών, και συμπεριφορικές ερωτήσεις. Ο γύρος πειραματισμού είναι αυτός που πιο συχνά κρίνει το αποτέλεσμα, επειδή είναι αυτός για τον οποίο οι υποψήφιοι προετοιμάζονται λιγότερο.

Οι συνεντεύξεις data scientist καλύπτουν SQL και Python, στατιστική και πιθανότητες, σχεδιασμό πειραμάτων και A/B testing, ένα case μοντελοποίησης ή μετρικών, και συμπεριφορικές ερωτήσεις. Ο γύρος πειραματισμού είναι αυτός που πιο συχνά κρίνει το αποτέλεσμα, επειδή είναι αυτός για τον οποίο οι υποψήφιοι προετοιμάζονται λιγότερο.

Ποιους γύρους περιλαμβάνει μια συνέντευξη data scientist;

Πιθανότατα έχεις προετοιμάσει SQL και λίγη μηχανική μάθηση, αλλά δεν είσαι σίγουρος τι άλλο θα ακολουθήσει. Αυτή η ενότητα χαρτογραφεί τους πέντε γύρους που επαναλαμβάνονται σε αυτές τις συνεντεύξεις, ώστε η προετοιμασία σου να ταιριάζει με τη βαθμολόγηση. Κάθε γύρος εξετάζει κάτι διαφορετικό, και η προετοιμασία μόνο των δύο τεχνικών γύρων είναι ο πιο συνηθισμένος τρόπος με τον οποίο δυνατοί υποψήφιοι χάνουν προσφορές.

  • SQL και κώδικας. Συγγραφή ερωτημάτων συν χειρισμό δεδομένων σε Python, συνήθως ζωντανά.
  • Στατιστική και πιθανότητες. Ερμηνεία και συλλογισμός, όχι αποδείξεις.
  • Σχεδιασμός πειραμάτων. A/B tests: τι μετράς, πόσο διάστημα τρέχεις, πότε εμπιστεύεσαι το αποτέλεσμα.
  • Μοντελοποίηση ή case. Ένα ανοιχτό πρόβλημα που πλαισιώνεις και μετά λύνεις σε υψηλό επίπεδο.
  • Συμπεριφορικά και stakeholders. Πώς χειρίστηκες την ασάφεια, τη διαφωνία και αποτελέσματα που κανείς δεν ήθελε.

Οι τίτλοι διαφέρουν. Μια εταιρεία που ονομάζει τον ρόλο data scientist μπορεί να τρέχει συνέντευξη analyst, και αντίστροφα. Αν θέλεις την έκδοση για analyst αυτής της σελίδας, βρίσκεται στον κόμβο ερωτήσεις συνέντευξης ανά ρόλο.

Ποιες ερωτήσεις στατιστικής και πειραματισμού εμφανίζονται;

Στατιστική και πιθανότητες

  • Τι σημαίνει πραγματικά μια τιμή p, και τι δεν σημαίνει;
  • Εξήγησε ένα διάστημα εμπιστοσύνης σε έναν product manager σε δύο προτάσεις.
  • Πότε θα χρησιμοποιούσες ένα t test αντί για ένα z test;
  • Τι είναι το κεντρικό οριακό θεώρημα και γιατί έχει σημασία για τη δουλειά σου;
  • Μια μετρική άλλαξε και το αποτέλεσμα είναι στατιστικά σημαντικό. Γιατί μπορεί να είναι παρόλα αυτά λάθος;
  • Εξήγησε το σφάλμα τύπου I και τύπου II χρησιμοποιώντας μια απόφαση που πραγματικά παίρνει η ομάδα σου.
  • Τι είναι το selection bias και πώς θα το εντόπιζες στα δεδομένα σου;
  • Πότε είναι η διάμεσος καλύτερη σύνοψη από τον μέσο όρο;

Σχεδιασμός πειραμάτων και A/B testing

  • Πώς θα σχεδίαζες ένα πείραμα για να δοκιμάσεις μια νέα ροή onboarding;
  • Πώς επιλέγεις το μέγεθος δείγματος, και τι συμβαίνει αν δεν μπορείς να το πετύχεις;
  • Το test σου είναι στατιστικά σημαντικό μετά από τρεις μέρες. Το κάνεις ship;
  • Τι είναι το novelty effect, και πώς θα το ξεχώριζες από μια πραγματική άνοδο;
  • Πώς χειρίζεσαι πολλαπλές μετρικές που κινούνται σε διαφορετικές κατευθύνσεις;
  • Τι θα έκανες αν η τυχαιοποίηση χαλούσε στη μέση του test;
  • Πώς θα μετρούσες κάτι που δεν μπορείς να τυχαιοποιήσεις, όπως μια αλλαγή τιμής σε ολόκληρη την αγορά;

Το μοτίβο που πρέπει να προσέξεις: σχεδόν καμία από αυτές δεν έχει μία σωστή απάντηση. Βαθμολογούνται με βάση το αν κατονομάζεις την υπόθεση, δηλώνεις το trade-off και λες τι θα έλεγχες.

Ποιες ερωτήσεις μοντελοποίησης, SQL και προϊόντος εμφανίζονται;

Μοντελοποίηση

  • Πώς θα έχτιζες ένα μοντέλο για να προβλέψεις το churn πελατών; Ξεκίνα με το πώς θα όριζες το churn.
  • Το μοντέλο σου έχει ακρίβεια 95 τοις εκατό σε ένα ανισόρροπο dataset. Είναι καλό;
  • Εξήγησε το bias variance trade-off χρησιμοποιώντας ένα μοντέλο που έχεις κάνει ship.
  • Πώς θα αποφάσιζες ανάμεσα σε ένα απλό και ένα σύνθετο μοντέλο για αυτό το πρόβλημα;
  • Πώς ξέρεις ότι ένα μοντέλο έχει σταματήσει να δουλεύει μετά το deployment;
  • Εξήγησε το regularisation σε κάποιον που δεν το έχει χρησιμοποιήσει.

SQL και Python

  • Γράψε ένα ερώτημα που επιστρέφει την πρώτη και την πιο πρόσφατη ημερομηνία αγοράς κάθε χρήστη.
  • Υπολόγισε έναν κυλιόμενο μέσο όρο επτά ημερών των ημερήσιων ενεργών χρηστών.
  • Βρες το ποσοστό μετατροπής ανά μήνα cohort.
  • Στο pandas, μετέτρεψε έναν μακρύ πίνακα σε πλατύ και εξήγησε πότε δεν θα το έκανες.
  • Πώς θα έβρισκες και θα χειριζόσουν διπλότυπες γραμμές σε έναν πίνακα συναλλαγών;

Product sense και μετρικές

  • Πώς θα μετρούσες αν ένα νέο feature είναι επιτυχημένο;
  • Οι ημερήσιοι ενεργοί χρήστες αυξάνονται αλλά τα έσοδα μένουν σταθερά. Διερεύνησε.
  • Ποια μία μετρική θα έβαζες στο dashboard της ηγεσίας, και ποια θα άφηνες έξω;
  • Πώς θα ξεχώριζες μια καλή καμπύλη διατήρησης από μια κακή;

Πώς πρέπει να τις εξασκείς;

Η ανάγνωση μιας λίστας ερωτήσεων χτίζει αναγνώριση. Οι συνεντεύξεις δοκιμάζουν την απόδοση υπό πίεση χρόνου με κάποιον να σε διακόπτει, και αυτές είναι διαφορετικές δεξιότητες. Το χάσμα φαίνεται περισσότερο στους γύρους πειράματος και case, όπου η απάντηση είναι ένα δομημένο επιχείρημα και όχι ένα γεγονός.

  • Απάντα δυνατά, με χρονόμετρο. Έξι λεπτά ανά ερώτηση case, χωρίς σημειώσεις, χωρίς επανεκκίνηση.
  • Πες πρώτα τις υποθέσεις σου. Το να κατονομάζεις τι υποθέτεις βαθμολογείται, και επίσης σου αγοράζει χρόνο σκέψης.
  • Εξασκήσου στο να σε διακόπτουν. Οι πραγματικοί συνεντευκτές διακόπτουν στο δεύτερο λεπτό. Η πρόβα ενός αδιάκοπου μονολόγου δεν σε προετοιμάζει για αυτό.
  • Γράψε SQL με το χέρι. Οι ζωντανοί γύροι συχνά χρησιμοποιούν έναν απλό editor χωρίς autocomplete και χωρίς τρόπο να τρέξεις το ερώτημα.
  • Εξήγησε κάθε αποτέλεσμα δύο φορές. Μία τεχνικά, μία σε έναν stakeholder που δεν νοιάζεται για τη μέθοδό σου.

Μια data scientist με τέσσερα χρόνια εμπειρίας προετοιμάστηκε για συνέντευξη σε marketplace διαβάζοντας εκατό ερωτήσεις σε ένα έγγραφο, και μετά κόλλησε στο «το test σου είναι στατιστικά σημαντικό μετά από τρεις μέρες, το κάνεις ship» επειδή δεν είχε πει ποτέ μια απάντηση δυνατά. Το περιεχόμενο ήταν στο μυαλό της· η εκφορά όχι. Αν θέλεις να τις εξασκήσεις με follow-up ερωτήσεις, η λειτουργία mock interview τρέχει τον γύρο και αμφισβητεί τις απαντήσεις σου.

Συχνές ερωτήσεις

Πόσο SQL χρειάζομαι για μια συνέντευξη data scientist;

Αρκετό ώστε να γράφεις joins, window functions και aggregations άνετα χωρίς τεκμηρίωση. Το SQL είναι φίλτρο και όχι διαφοροποιητής: το να το περάσεις είναι αναμενόμενο, και καμία επιπλέον στίλβωση SQL δεν αντισταθμίζει έναν αδύναμο γύρο πειραματισμού.

Ποια είναι η διαφορά ανάμεσα σε ερωτήσεις data scientist και data analyst;

Οι συνεντεύξεις analyst επικεντρώνονται σε SQL και business case. Οι συνεντεύξεις data scientist προσθέτουν σχεδιασμό πειραμάτων και μοντελοποίηση, και μετακινούν τη στατιστική από την ερμηνεία σε αποφάσεις σχεδιασμού. Οι γύροι συμπεριφοράς και stakeholders είναι σχεδόν ίδιοι.

Χρειάζομαι βάθος machine learning για κάθε ρόλο data scientist;

Όχι. Οι ρόλοι product data scientist συχνά δίνουν πολύ μεγαλύτερο βάρος στον πειραματισμό και τις μετρικές παρά στη μοντελοποίηση, ενώ οι ρόλοι έρευνας ή πλατφόρμας το αντιστρέφουν. Ρώτα τον recruiter ποιους γύρους έχεις προγραμματισμένους πριν επιλέξεις τι να μελετήσεις.

Ποιος είναι ο πιο συνηθισμένος λόγος που οι υποψήφιοι αποτυγχάνουν σε αυτές τις συνεντεύξεις;

Το να απαντούν στις ερωτήσεις πειράματος και case ως γεγονότα και όχι ως επιχειρήματα. Οι συνεντευκτές βαθμολογούν αν κατονόμασες την υπόθεση, επέλεξες μια μετρική σκόπιμα και είπες τι θα έλεγχες, όχι αν έφτασες στο προτιμώμενο συμπέρασμά τους.

Πώς εξασκούμαι σε αυτές τις ερωτήσεις χωρίς σύντροφο;

Απάντα δυνατά με χρονόμετρο και ηχογράφησε τον εαυτό σου, μετά έλεγξε αν δήλωσες υποθέσεις και δομή. Ένας AI mock interviewer μπορεί επίσης να τρέξει τον γύρο και να διακόπτει με follow-up ερωτήσεις, κάτι πιο κοντά στην πραγματική πίεση από το να διαβάζεις μια λίστα.

Σχετικές ερωτήσεις

← Περισσότερα για Ερωτήσεις συνέντευξης ανά ρόλο & θέμα