डेटा साइंटिस्ट इंटरव्यू के सवाल, राउंड के अनुसार
द्वारा Aaron Cao · अपडेट

डेटा साइंटिस्ट इंटरव्यू में SQL और Python, सांख्यिकी और प्रायिकता, प्रयोग डिज़ाइन और A/B टेस्टिंग, एक मॉडलिंग या मेट्रिक्स केस, और व्यवहार से जुड़े सवाल शामिल होते हैं। एक्सपेरिमेंटेशन राउंड ही अक्सर नतीजा तय करता है, क्योंकि उम्मीदवार इसकी तैयारी सबसे कम करते हैं।
डेटा साइंटिस्ट इंटरव्यू में कौन-कौन से राउंड होते हैं?
आपने शायद SQL और थोड़ी मशीन लर्निंग तैयार कर ली होगी, और आपको यकीन नहीं है कि आगे और क्या आएगा। यह सेक्शन उन पाँच राउंड को दिखाता है जिन्हें ये इंटरव्यू बार-बार इस्तेमाल करते हैं, ताकि आपकी तैयारी स्कोरिंग से मेल खाए। हर राउंड कुछ अलग जांचता है, और सिर्फ़ दो तकनीकी राउंड की तैयारी करना वह सबसे आम वजह है जिससे मज़बूत उम्मीदवार ऑफ़र गंवाते हैं।
- SQL और कोडिंग। क्वेरी लिखना और Python से डेटा मैनिपुलेशन, अक्सर लाइव।
- सांख्यिकी और प्रायिकता। व्याख्या और तर्क, प्रूफ़ नहीं।
- प्रयोग डिज़ाइन। A/B टेस्ट: क्या मापना है, कितनी देर चलाना है, नतीजे पर कब भरोसा करना है।
- मॉडलिंग या केस। एक खुली समस्या जिसे आप तय करके ऊँचे स्तर पर हल करते हैं।
- व्यवहार और स्टेकहोल्डर। आपने अस्पष्टता, असहमति और अनचाहे नतीजों को कैसे संभाला।
पदनाम अलग-अलग होते हैं। जो कंपनी इस भूमिका को डेटा साइंटिस्ट कहती है वह असल में एनालिस्ट इंटरव्यू ले सकती है, और इसका उल्टा भी सच है। अगर आपको इस पेज का एनालिस्ट वर्ज़न चाहिए, तो वह भूमिका के अनुसार इंटरव्यू सवाल हब में है।
सांख्यिकी और एक्सपेरिमेंटेशन के कौन से सवाल आते हैं?
सांख्यिकी और प्रायिकता
- p वैल्यू का असल मतलब क्या है, और इसका मतलब क्या नहीं है?
- एक प्रोडक्ट मैनेजर को कॉन्फ़िडेंस इंटरवल दो वाक्यों में समझाइए।
- आप z टेस्ट की जगह t टेस्ट कब इस्तेमाल करेंगे?
- सेंट्रल लिमिट थ्योरम क्या है, और यह आपके काम के लिए क्यों मायने रखता है?
- एक मेट्रिक बदली और नतीजा सिग्निफ़िकेंट है। फिर भी यह गलत क्यों हो सकता है?
- Type I और Type II एरर को अपनी टीम के किसी असली फ़ैसले से समझाइए।
- सिलेक्शन बायस क्या है, और आप इसे अपने डेटा में कैसे पकड़ेंगे?
- मीडियन, मीन से बेहतर समरी कब होती है?
प्रयोग डिज़ाइन और A/B टेस्टिंग
- नए ऑनबोर्डिंग फ़्लो को टेस्ट करने के लिए आप एक्सपेरिमेंट कैसे डिज़ाइन करेंगे?
- आप सैंपल साइज़ कैसे तय करते हैं, और अगर उस तक न पहुँच पाएँ तो क्या होता है?
- तीन दिन बाद आपका टेस्ट सिग्निफ़िकेंट हो जाता है। क्या आप इसे शिप करेंगे?
- नॉवेल्टी इफ़ेक्ट क्या है, और आप इसे असली लिफ़्ट से कैसे अलग करेंगे?
- अगर कई मेट्रिक्स अलग-अलग दिशाओं में बढ़ें, तो आप इसे कैसे संभालते हैं?
- अगर टेस्ट के बीच में रैंडमाइज़ेशन टूट जाए, तो आप क्या करेंगे?
- जिसे आप रैंडमाइज़ नहीं कर सकते, जैसे पूरे मार्केट में एक प्राइसिंग बदलाव, उसे आप कैसे मापेंगे?
ध्यान देने वाला पैटर्न यह है: इनमें से लगभग किसी का भी एक ही सही जवाब नहीं है। इन्हें इस आधार पर परखा जाता है कि आप धारणा बताते हैं या नहीं, ट्रेडऑफ़ स्पष्ट करते हैं या नहीं, और यह बताते हैं या नहीं कि आप क्या जाँचेंगे।
मॉडलिंग, SQL और प्रोडक्ट से जुड़े कौन से सवाल आते हैं?
मॉडलिंग
- कस्टमर चर्न की भविष्यवाणी के लिए आप मॉडल कैसे बनाएँगे? पहले बताइए कि आप चर्न को कैसे परिभाषित करेंगे।
- आपके मॉडल की एक असंतुलित डेटासेट पर 95 प्रतिशत एक्यूरेसी है। क्या यह अच्छा है?
- अपने किसी शिप किए मॉडल से बायस-वैरिएंस ट्रेडऑफ़ समझाइए।
- इस समस्या के लिए आप एक सिंपल और एक जटिल मॉडल में से कैसे चुनेंगे?
- डिप्लॉयमेंट के बाद आपको कैसे पता चलता है कि मॉडल काम करना बंद कर चुका है?
- रेगुलराइज़ेशन को किसी ऐसे इंसान को समझाइए जिसने इसे कभी इस्तेमाल नहीं किया।
SQL और Python
- एक ऐसी क्वेरी लिखिए जो हर यूज़र की पहली और सबसे हाल की खरीद तारीख लौटाए।
- डेली एक्टिव यूज़र्स का सात दिन का रोलिंग एवरेज निकालिए।
- कोहोर्ट महीने के हिसाब से कन्वर्ज़न रेट पता कीजिए।
pandasमें एक लॉन्ग टेबल को वाइड में बदलिए, और बताइए कि आप ऐसा कब नहीं करेंगे।- एक ट्रांज़ैक्शन टेबल में डुप्लिकेट रो आप कैसे ढूँढेंगे और कैसे संभालेंगे?
प्रोडक्ट सेंस और मेट्रिक्स
- आप कैसे मापेंगे कि कोई नया फ़ीचर सफल है या नहीं?
- डेली एक्टिव यूज़र्स बढ़ रहे हैं लेकिन रेवेन्यू सपाट है। इसकी जाँच कीजिए।
- आप लीडरशिप डैशबोर्ड पर कौन सी एक मेट्रिक रखेंगे, और किसे छोड़ेंगे?
- अच्छी और ख़राब रिटेंशन कर्व में आप फ़र्क़ कैसे बताएँगे?
इनका अभ्यास आपको कैसे करना चाहिए?
सवालों की सूची पढ़ने से पहचान बनती है। इंटरव्यू आपको समय के दबाव में परखते हैं, जबकि कोई आपको बीच में टोकता है, और ये अलग स्किल हैं। यह फ़र्क़ सबसे ज़्यादा एक्सपेरिमेंट और केस राउंड में दिखता है, जहाँ जवाब एक तथ्य नहीं बल्कि एक सुव्यवस्थित तर्क होता है।
- ज़ोर से बोलकर, टाइमर के साथ जवाब दें। हर केस सवाल के लिए छह मिनट, बिना नोट्स, बिना दोबारा शुरू किए।
- पहले अपनी धारणाएँ बताएँ। आप क्या मान रहे हैं यह बताना परखा जाता है, और इससे सोचने का समय भी मिलता है।
- टोके जाने का अभ्यास करें। असली इंटरव्यूअर दूसरे मिनट में ही टोक देते हैं। बिना रुकावट वाला मोनोलॉग रिहर्स करना आपको इसके लिए तैयार नहीं करता।
- SQL हाथ से लिखें। लाइव राउंड में अक्सर एक सादा एडिटर होता है, बिना ऑटोकम्प्लीट और क्वेरी चलाने के तरीक़े के बिना।
- हर नतीजा दो बार समझाएँ। एक बार तकनीकी रूप से, एक बार किसी स्टेकहोल्डर के लिए जिसे आपकी विधि से फ़र्क़ नहीं पड़ता।
चार साल के अनुभव वाली एक डेटा साइंटिस्ट ने मार्केटप्लेस इंटरव्यू के लिए एक दस्तावेज़ में सौ सवाल दोहराकर तैयारी की, और फिर "तीन दिन बाद आपका टेस्ट सिग्निफ़िकेंट हो जाता है, क्या आप इसे शिप करेंगे" पर अटक गई, क्योंकि उसने इसका जवाब कभी ज़ोर से बोला ही नहीं था। कंटेंट उसके दिमाग़ में था; डिलीवरी नहीं थी। अगर आप फ़ॉलो-अप के साथ इनका अभ्यास चाहते हैं, तो मॉक इंटरव्यू मोड यह राउंड चलाता है और आपके जवाबों पर सवाल उठाता है।
सामान्य प्रश्न
डेटा साइंटिस्ट इंटरव्यू के लिए मुझे कितना SQL आना चाहिए?
डेटा साइंटिस्ट और डेटा एनालिस्ट के सवालों में क्या फ़र्क़ है?
क्या हर डेटा साइंटिस्ट भूमिका के लिए मुझे मशीन लर्निंग में गहराई चाहिए?
उम्मीदवारों के इन इंटरव्यू में असफल होने की सबसे आम वजह क्या है?
बिना किसी पार्टनर के मैं इन सवालों का अभ्यास कैसे करूँ?
संबंधित प्रश्न
- डेटा इंजीनियर इंटरव्यू में कौन से सवाल पूछे जाते हैं?
- डेटा एनालिस्ट इंटरव्यू में कौन से प्रश्न पूछे जाते हैं?
- प्रोडक्ट मैनेजर इंटरव्यू में कौन-से सवाल पूछे जाते हैं?
- इंटरव्यू में डेवलपर्स से Copilot और AI कोडिंग असिस्टेंट के बारे में कौन से प्रश्न पूछे जाते हैं?
- दूसरे इंटरव्यू में कौन से सवाल पूछे जाते हैं?
- एआई इंटरव्यू में कौन-से सवाल पूछे जाते हैं?