डेटा साइंटिस्ट इंटरव्यू के सवाल, राउंड के अनुसार

द्वारा Aaron Cao · अपडेट

डेटा साइंटिस्ट इंटरव्यू के सवाल, राउंड के अनुसार
डेटा साइंटिस्ट इंटरव्यू में SQL और Python, सांख्यिकी और प्रायिकता, प्रयोग डिज़ाइन और A/B टेस्टिंग, एक मॉडलिंग या मेट्रिक्स केस, और व्यवहार से जुड़े सवाल शामिल होते हैं। एक्सपेरिमेंटेशन राउंड ही अक्सर नतीजा तय करता है, क्योंकि उम्मीदवार इसकी तैयारी सबसे कम करते हैं।

डेटा साइंटिस्ट इंटरव्यू में SQL और Python, सांख्यिकी और प्रायिकता, प्रयोग डिज़ाइन और A/B टेस्टिंग, एक मॉडलिंग या मेट्रिक्स केस, और व्यवहार से जुड़े सवाल शामिल होते हैं। एक्सपेरिमेंटेशन राउंड ही अक्सर नतीजा तय करता है, क्योंकि उम्मीदवार इसकी तैयारी सबसे कम करते हैं।

डेटा साइंटिस्ट इंटरव्यू में कौन-कौन से राउंड होते हैं?

आपने शायद SQL और थोड़ी मशीन लर्निंग तैयार कर ली होगी, और आपको यकीन नहीं है कि आगे और क्या आएगा। यह सेक्शन उन पाँच राउंड को दिखाता है जिन्हें ये इंटरव्यू बार-बार इस्तेमाल करते हैं, ताकि आपकी तैयारी स्कोरिंग से मेल खाए। हर राउंड कुछ अलग जांचता है, और सिर्फ़ दो तकनीकी राउंड की तैयारी करना वह सबसे आम वजह है जिससे मज़बूत उम्मीदवार ऑफ़र गंवाते हैं।

  • SQL और कोडिंग। क्वेरी लिखना और Python से डेटा मैनिपुलेशन, अक्सर लाइव।
  • सांख्यिकी और प्रायिकता। व्याख्या और तर्क, प्रूफ़ नहीं।
  • प्रयोग डिज़ाइन। A/B टेस्ट: क्या मापना है, कितनी देर चलाना है, नतीजे पर कब भरोसा करना है।
  • मॉडलिंग या केस। एक खुली समस्या जिसे आप तय करके ऊँचे स्तर पर हल करते हैं।
  • व्यवहार और स्टेकहोल्डर। आपने अस्पष्टता, असहमति और अनचाहे नतीजों को कैसे संभाला।

पदनाम अलग-अलग होते हैं। जो कंपनी इस भूमिका को डेटा साइंटिस्ट कहती है वह असल में एनालिस्ट इंटरव्यू ले सकती है, और इसका उल्टा भी सच है। अगर आपको इस पेज का एनालिस्ट वर्ज़न चाहिए, तो वह भूमिका के अनुसार इंटरव्यू सवाल हब में है।

सांख्यिकी और एक्सपेरिमेंटेशन के कौन से सवाल आते हैं?

सांख्यिकी और प्रायिकता

  • p वैल्यू का असल मतलब क्या है, और इसका मतलब क्या नहीं है?
  • एक प्रोडक्ट मैनेजर को कॉन्फ़िडेंस इंटरवल दो वाक्यों में समझाइए।
  • आप z टेस्ट की जगह t टेस्ट कब इस्तेमाल करेंगे?
  • सेंट्रल लिमिट थ्योरम क्या है, और यह आपके काम के लिए क्यों मायने रखता है?
  • एक मेट्रिक बदली और नतीजा सिग्निफ़िकेंट है। फिर भी यह गलत क्यों हो सकता है?
  • Type I और Type II एरर को अपनी टीम के किसी असली फ़ैसले से समझाइए।
  • सिलेक्शन बायस क्या है, और आप इसे अपने डेटा में कैसे पकड़ेंगे?
  • मीडियन, मीन से बेहतर समरी कब होती है?

प्रयोग डिज़ाइन और A/B टेस्टिंग

  • नए ऑनबोर्डिंग फ़्लो को टेस्ट करने के लिए आप एक्सपेरिमेंट कैसे डिज़ाइन करेंगे?
  • आप सैंपल साइज़ कैसे तय करते हैं, और अगर उस तक न पहुँच पाएँ तो क्या होता है?
  • तीन दिन बाद आपका टेस्ट सिग्निफ़िकेंट हो जाता है। क्या आप इसे शिप करेंगे?
  • नॉवेल्टी इफ़ेक्ट क्या है, और आप इसे असली लिफ़्ट से कैसे अलग करेंगे?
  • अगर कई मेट्रिक्स अलग-अलग दिशाओं में बढ़ें, तो आप इसे कैसे संभालते हैं?
  • अगर टेस्ट के बीच में रैंडमाइज़ेशन टूट जाए, तो आप क्या करेंगे?
  • जिसे आप रैंडमाइज़ नहीं कर सकते, जैसे पूरे मार्केट में एक प्राइसिंग बदलाव, उसे आप कैसे मापेंगे?

ध्यान देने वाला पैटर्न यह है: इनमें से लगभग किसी का भी एक ही सही जवाब नहीं है। इन्हें इस आधार पर परखा जाता है कि आप धारणा बताते हैं या नहीं, ट्रेडऑफ़ स्पष्ट करते हैं या नहीं, और यह बताते हैं या नहीं कि आप क्या जाँचेंगे।

मॉडलिंग, SQL और प्रोडक्ट से जुड़े कौन से सवाल आते हैं?

मॉडलिंग

  • कस्टमर चर्न की भविष्यवाणी के लिए आप मॉडल कैसे बनाएँगे? पहले बताइए कि आप चर्न को कैसे परिभाषित करेंगे।
  • आपके मॉडल की एक असंतुलित डेटासेट पर 95 प्रतिशत एक्यूरेसी है। क्या यह अच्छा है?
  • अपने किसी शिप किए मॉडल से बायस-वैरिएंस ट्रेडऑफ़ समझाइए।
  • इस समस्या के लिए आप एक सिंपल और एक जटिल मॉडल में से कैसे चुनेंगे?
  • डिप्लॉयमेंट के बाद आपको कैसे पता चलता है कि मॉडल काम करना बंद कर चुका है?
  • रेगुलराइज़ेशन को किसी ऐसे इंसान को समझाइए जिसने इसे कभी इस्तेमाल नहीं किया।

SQL और Python

  • एक ऐसी क्वेरी लिखिए जो हर यूज़र की पहली और सबसे हाल की खरीद तारीख लौटाए।
  • डेली एक्टिव यूज़र्स का सात दिन का रोलिंग एवरेज निकालिए।
  • कोहोर्ट महीने के हिसाब से कन्वर्ज़न रेट पता कीजिए।
  • pandas में एक लॉन्ग टेबल को वाइड में बदलिए, और बताइए कि आप ऐसा कब नहीं करेंगे।
  • एक ट्रांज़ैक्शन टेबल में डुप्लिकेट रो आप कैसे ढूँढेंगे और कैसे संभालेंगे?

प्रोडक्ट सेंस और मेट्रिक्स

  • आप कैसे मापेंगे कि कोई नया फ़ीचर सफल है या नहीं?
  • डेली एक्टिव यूज़र्स बढ़ रहे हैं लेकिन रेवेन्यू सपाट है। इसकी जाँच कीजिए।
  • आप लीडरशिप डैशबोर्ड पर कौन सी एक मेट्रिक रखेंगे, और किसे छोड़ेंगे?
  • अच्छी और ख़राब रिटेंशन कर्व में आप फ़र्क़ कैसे बताएँगे?

इनका अभ्यास आपको कैसे करना चाहिए?

सवालों की सूची पढ़ने से पहचान बनती है। इंटरव्यू आपको समय के दबाव में परखते हैं, जबकि कोई आपको बीच में टोकता है, और ये अलग स्किल हैं। यह फ़र्क़ सबसे ज़्यादा एक्सपेरिमेंट और केस राउंड में दिखता है, जहाँ जवाब एक तथ्य नहीं बल्कि एक सुव्यवस्थित तर्क होता है।

  • ज़ोर से बोलकर, टाइमर के साथ जवाब दें। हर केस सवाल के लिए छह मिनट, बिना नोट्स, बिना दोबारा शुरू किए।
  • पहले अपनी धारणाएँ बताएँ। आप क्या मान रहे हैं यह बताना परखा जाता है, और इससे सोचने का समय भी मिलता है।
  • टोके जाने का अभ्यास करें। असली इंटरव्यूअर दूसरे मिनट में ही टोक देते हैं। बिना रुकावट वाला मोनोलॉग रिहर्स करना आपको इसके लिए तैयार नहीं करता।
  • SQL हाथ से लिखें। लाइव राउंड में अक्सर एक सादा एडिटर होता है, बिना ऑटोकम्प्लीट और क्वेरी चलाने के तरीक़े के बिना।
  • हर नतीजा दो बार समझाएँ। एक बार तकनीकी रूप से, एक बार किसी स्टेकहोल्डर के लिए जिसे आपकी विधि से फ़र्क़ नहीं पड़ता।

चार साल के अनुभव वाली एक डेटा साइंटिस्ट ने मार्केटप्लेस इंटरव्यू के लिए एक दस्तावेज़ में सौ सवाल दोहराकर तैयारी की, और फिर "तीन दिन बाद आपका टेस्ट सिग्निफ़िकेंट हो जाता है, क्या आप इसे शिप करेंगे" पर अटक गई, क्योंकि उसने इसका जवाब कभी ज़ोर से बोला ही नहीं था। कंटेंट उसके दिमाग़ में था; डिलीवरी नहीं थी। अगर आप फ़ॉलो-अप के साथ इनका अभ्यास चाहते हैं, तो मॉक इंटरव्यू मोड यह राउंड चलाता है और आपके जवाबों पर सवाल उठाता है।

सामान्य प्रश्न

डेटा साइंटिस्ट इंटरव्यू के लिए मुझे कितना SQL आना चाहिए?

इतना कि आप बिना डॉक्यूमेंटेशन के joins, window functions और aggregations आसानी से लिख सकें। SQL एक फ़िल्टर है, डिफ़रेंशिएटर नहीं: इसे पास करना अपेक्षित है, और SQL में कितनी भी अतिरिक्त पॉलिश एक कमज़ोर एक्सपेरिमेंटेशन राउंड की भरपाई नहीं करती।

डेटा साइंटिस्ट और डेटा एनालिस्ट के सवालों में क्या फ़र्क़ है?

एनालिस्ट इंटरव्यू SQL और बिज़नेस केस पर केंद्रित होते हैं। डेटा साइंटिस्ट इंटरव्यू में एक्सपेरिमेंट डिज़ाइन और मॉडलिंग भी जुड़ जाते हैं, और सांख्यिकी को व्याख्या से आगे बढ़ाकर डिज़ाइन फ़ैसलों तक ले जाया जाता है। व्यवहार और स्टेकहोल्डर राउंड लगभग एक जैसे ही होते हैं।

क्या हर डेटा साइंटिस्ट भूमिका के लिए मुझे मशीन लर्निंग में गहराई चाहिए?

नहीं। प्रोडक्ट डेटा साइंटिस्ट भूमिकाओं में अक्सर मॉडलिंग से कहीं ज़्यादा वेटेज एक्सपेरिमेंटेशन और मेट्रिक्स को मिलता है, जबकि रिसर्च या प्लेटफ़ॉर्म भूमिकाओं में यह उल्टा होता है। क्या पढ़ना है यह तय करने से पहले रिक्रूटर से पूछें कि आपके कौन से राउंड शेड्यूल हैं।

उम्मीदवारों के इन इंटरव्यू में असफल होने की सबसे आम वजह क्या है?

एक्सपेरिमेंट और केस सवालों को तर्क की जगह तथ्य की तरह जवाब देना। इंटरव्यूअर यह परखते हैं कि आपने धारणा बताई, सोच-समझकर मेट्रिक चुनी, और बताया कि आप क्या जाँचेंगे, न कि आप उनके पसंदीदा निष्कर्ष तक पहुँचे या नहीं।

बिना किसी पार्टनर के मैं इन सवालों का अभ्यास कैसे करूँ?

टाइमर के साथ ज़ोर से जवाब दें और खुद को रिकॉर्ड करें, फिर देखें कि आपने धारणाएँ और स्ट्रक्चर बताया या नहीं। एक AI मॉक इंटरव्यूअर भी यह राउंड चला सकता है और फ़ॉलो-अप से टोक सकता है, जो सूची पढ़ने से कहीं ज़्यादा असली दबाव जैसा है।

संबंधित प्रश्न

← और देखें: भूमिका और विषय के अनुसार इंटरव्यू प्रश्न