Data Engineer Interview Questions, राउंड के अनुसार

द्वारा Aaron Cao · अपडेट

Data Engineer Interview Questions, राउंड के अनुसार
डेटा इंजीनियर लूप में एडवांस्ड SQL, डेटा मॉडलिंग, पाइपलाइन और ETL डिज़ाइन, डिस्ट्रिब्यूटेड प्रोसेसिंग, और बिहेवियरल राउंड शामिल होते हैं। पाइपलाइन डिज़ाइन राउंड ज़्यादातर नतीजे तय करता है: यह पूछता है कि आप देर से आए डेटा, रीरन और फेलियर को कैसे संभालते हैं, न कि आप कौन सा टूल पसंद करते हैं।

डेटा इंजीनियर लूप में एडवांस्ड SQL, डेटा मॉडलिंग, पाइपलाइन और ETL डिज़ाइन, डिस्ट्रिब्यूटेड प्रोसेसिंग, और बिहेवियरल राउंड शामिल होते हैं। पाइपलाइन डिज़ाइन राउंड ज़्यादातर नतीजे तय करता है: यह पूछता है कि आप देर से आए डेटा, रीरन और फेलियर को कैसे संभालते हैं, न कि आप कौन सा टूल पसंद करते हैं।

डेटा इंजीनियर लूप में कौन से राउंड होते हैं?

हो सकता है आप सॉफ्टवेयर इंजीनियरिंग लूप जैसी ही तैयारी कर रहे हों, और सोच रहे हों कि फर्क क्या है। यह सेक्शन उन राउंड को मैप करता है जो ये इंटरव्यू दोहराते हैं, ताकि आप अपना समय उन दो राउंड पर लगाएं जो असल में कैंडिडेट्स को अलग करते हैं। टेक्निकल फिल्टर पर शायद ही ऑफर खोए जाते हैं।

  • SQL. विंडो फंक्शन, डीडुप्लिकेशन, और क्वेरी परफॉर्मेंस, आमतौर पर लाइव।
  • डेटा मॉडलिंग. बताए गए बिज़नेस के लिए टेबल डिज़ाइन करना, और चुने गए ग्रेन को डिफेंड करना।
  • पाइपलाइन और ETL डिज़ाइन. डेटा मूवमेंट तक सीमित एक ओपन-एंडेड सिस्टम डिज़ाइन राउंड।
  • डिस्ट्रिब्यूटेड प्रोसेसिंग. कोई फ्रेमवर्क असल में आपका जॉब कैसे रन करता है, और वह धीमा क्यों है।
  • कोडिंग. Python या Scala, अक्सर सॉफ्टवेयर इंजीनियरिंग राउंड से हल्का।
  • बिहेवियरल. ऑन-कॉल इंसिडेंट्स, टूटे डैशबोर्ड, और स्टेकहोल्डर जो कल ही नंबर चाहते थे।

टाइटल एनालिटिक्स इंजीनियरिंग और प्लेटफॉर्म रोल्स से काफी ओवरलैप करते हैं, इसलिए मिक्स बदलता रहता है। संबंधित रोल बैंक भूमिका के अनुसार इंटरव्यू सवाल हब पर हैं।

कौन से SQL और डेटा मॉडलिंग सवाल आते हैं?

SQL

  • एक टेबल को डीडुप्लिकेट करें, हर key के लिए सिर्फ सबसे नई row रखते हुए।
  • ऐसी क्वेरी लिखें जो हर यूज़र का सेशन काउंट 30 मिनट के इनएक्टिविटी गैप के आधार पर लौटाए।
  • एक ही क्वेरी में रनिंग टोटल और मंथ-ओवर-मंथ चेंज कैलकुलेट करें।
  • कल के स्नैपशॉट में मौजूद पर आज के स्नैपशॉट में गायब rows ढूंढें।
  • QUALIFY क्या करता है, और इसके बिना आप क्या लिखेंगे?
  • यह क्वेरी एक अरब rows स्कैन करती है और बीस मिनट लेती है। आप इसे कैसे डायग्नोज़ करेंगे?
  • पार्टीशनिंग और क्लस्टरिंग के फर्क को समझाएं, और हर एक कब मदद करता है।

डेटा मॉडलिंग

  • एक ऑनलाइन मार्केटप्लेस की ऑर्डर हिस्ट्री के लिए टेबल डिज़ाइन करें। आपकी फैक्ट टेबल का ग्रेन क्या है?
  • स्टार स्कीमा समझाएं, और आप कब जानबूझकर और डीनॉर्मलाइज़ करेंगे।
  • स्लोली चेंजिंग डाइमेंशन क्या है, और आप टाइप टू कैसे लागू करते हैं?
  • एक स्टेकहोल्डर चाहता है कि हिस्टोरिकल रिपोर्टिंग कस्टमर के मौजूदा region को दिखाए। क्या टूटता है?
  • आप एक ऐसे इवेंट स्ट्रीम को कैसे मॉडल करेंगे जो आउट-ऑफ-ऑर्डर आता है?
  • आप नॉर्मलाइज़्ड मॉडल की जगह वाइड टेबल कब चुनेंगे?

मॉडलिंग राउंड एक ग्रेन तय करने और उसे डिफेंड करने को इनाम देता है। जो कैंडिडेट बिना चुने तीन संभावित डिज़ाइन बताते हैं, वे उन कैंडिडेट्स से कमज़ोर स्कोर करते हैं जो एक ठीक डिज़ाइन चुनकर उसकी कमज़ोरी बताते हैं।

कौन से पाइपलाइन और डिस्ट्रिब्यूटेड प्रोसेसिंग सवाल आते हैं?

पाइपलाइन और ETL डिज़ाइन

  • एक पाइपलाइन डिज़ाइन करें जो रिपोर्टिंग के लिए रोज़ का ट्रांज़ैक्शन डेटा वेयरहाउस में लोड करे।
  • अपस्ट्रीम सोर्स कल का डेटा फिर से भेजता है। आपके जॉब का क्या होता है?
  • आप पाइपलाइन को आइडेम्पोटेंट कैसे बनाते हैं, और रीरन के लिए यह क्यों मायने रखता है?
  • रोज़ के लोड को बाधित किए बिना आप दो साल की हिस्ट्री का बैकफिल कैसे करेंगे?
  • पार्टीशन बंद होने के तीन दिन बाद देर से आया डेटा दिखता है। आप क्या करते हैं?
  • आप कैसे पता लगाएंगे कि पाइपलाइन सफल तो हुई पर गलत डेटा बना दिया?
  • आप क्या मॉनिटर करते हैं, और रात के तीन बजे किसी को क्या पेज करता है?

डिस्ट्रिब्यूटेड प्रोसेसिंग और स्ट्रीमिंग

  • शफल किस वजह से होता है, और वह महंगा क्यों है?
  • आपका जॉब धीमा है और एक टास्क बाकियों से कहीं ज़्यादा समय लेता है। क्या हो रहा है?
  • डेटा स्क्यू समझाएं और इसे संभालने के दो तरीके बताएं।
  • आप शेड्यूल्ड बैच जॉब की जगह स्ट्रीमिंग कब चुनेंगे?
  • exactly once प्रोसेसिंग असल में क्या गारंटी देती है, और यह कहां लागू नहीं होती?
  • वॉटरमार्क विंडोड एग्रीगेशन में आउट-ऑफ-ऑर्डर इवेंट्स को कैसे संभालते हैं?

ध्यान दें कि इनमें से कितने कम सवाल आपसे टूल का नाम मांगते हैं। नाम बताना जवाब की शुरुआत है, जवाब नहीं। फॉलो-अप हमेशा क्यों और क्या टूटता है, यही होता है।

इनका अभ्यास कैसे करें?

ये लिस्ट पढ़ना पहचान बनाता है। डिज़ाइन राउंड कुछ और परखते हैं: सिस्टम को दिमाग में रखना जबकि कोई आपको एक फेलियर केस से टोके। यह सिर्फ डिज़ाइन को ज़ोर से बोलने से आता है।

  • पंद्रह मिनट में एक पाइपलाइन बनाएं और उसे बताएं। सोर्स, लैंडिंग, ट्रांसफॉर्म, सर्व, साथ ही हर स्टेज कैसे फेल होती है।
  • अपने ही डिज़ाइन पर हमला करें। हर प्रैक्टिस रन के बाद पूछें कि रीरन पर, देर से आए डेटा पर, और स्कीमा चेंज पर क्या होता है।
  • स्केल के लिए एक नंबर तैयार रखें। रोज़ की rows, साइज़, लेटेंसी बजट। अपना अनुमानित स्केल पहले बताना स्कोर होता है।
  • SQL हाथ से लिखें। लाइव राउंड अक्सर बिना ऑटोकम्प्लीट और बिना एग्ज़ीक्यूशन वाला प्लेन एडिटर इस्तेमाल करते हैं।
  • एक इंसिडेंट स्टोरी को ठीक से रिहर्स करें। क्या टूटा, आपने इसे कैसे ढूंढा, आपने क्या बदला ताकि यह दोबारा न हो।

बैच पाइपलाइन पर छह साल के अनुभव वाली एक डेटा इंजीनियर ने फ्रेमवर्क इंटरनल्स दोहराकर तैयारी की, फिर "अपस्ट्रीम सोर्स ने कल की फाइल फिर भेज दी" पर अटक गई क्योंकि उसने इसे हमेशा हाथ से संभाला था, कभी समझाया नहीं था। नॉलेज था; बोला गया जवाब नहीं था। फॉलो-अप के साथ डिज़ाइन राउंड का अभ्यास करना ठीक वही है जिसके लिए mock interview मोड बनाया गया है।

सामान्य प्रश्न

डेटा इंजीनियर इंटरव्यू सॉफ्टवेयर इंजीनियर इंटरव्यू से कैसे अलग है?

कोडिंग राउंड आमतौर पर हल्का होता है और डिज़ाइन राउंड सर्विसेज़ की बजाय डेटा मूवमेंट तक सीमित होता है। सवाल रीरन, देर से आए डेटा, और स्कीमा चेंज के तहत सही होने पर केंद्रित होते हैं, जो एक सामान्य सॉफ्टवेयर डिज़ाइन राउंड में शायद ही आते हैं।

क्या मुझे खासतौर पर Spark चाहिए, या कॉन्सेप्ट काफी है?

कॉन्सेप्ट ही राउंड का ज़्यादातर हिस्सा उठाते हैं: शफल, स्क्यू, पार्टीशनिंग, और जॉब धीमा क्यों है। अगर जॉब डिस्क्रिप्शन किसी फ्रेमवर्क का नाम लेता है, तो उसके एग्ज़ीक्यूशन मॉडल पर कम से कम एक सवाल की उम्मीद रखें, इसलिए यह बताने में सक्षम रहें कि आपका जॉब चलने पर क्या होता है।

ये इंटरव्यू कितनी डेटा मॉडलिंग परखते हैं?

ज़्यादातर कैंडिडेट्स की उम्मीद से ज़्यादा। स्टार स्कीमा, फैक्ट टेबल का ग्रेन, और स्लोली चेंजिंग डाइमेंशन नियमित रूप से आते हैं, और इंटरव्यूअर टेक्स्टबुक डेफिनिशन मांगने की बजाय आपकी चॉइस के नतीजों पर दबाव डालते हैं।

कैंडिडेट्स के डेटा इंजीनियर लूप में फेल होने की सबसे आम वजह क्या है?

ऐसी पाइपलाइन डिज़ाइन करना जो सिर्फ हैप्पी पाथ पर काम करे। इंटरव्यूअर जानबूझकर रीरन, डुप्लिकेट डिलीवरी, और देर से आए डेटा डालते हैं, और जिस डिज़ाइन के पास इनका जवाब नहीं होता, वही आम तौर पर फेल होता है।

मैं अकेले डिज़ाइन राउंड का अभ्यास कैसे करूं?

एक बताया गया बिज़नेस चुनें, टाइमर पर पाइपलाइन को ज़ोर से डिज़ाइन करें, फिर अपने ही डिज़ाइन को फेलियर केसेज़ से परखें। एक AI mock interviewer भी राउंड चला सकता है और फॉलो-अप से टोक सकता है, जो असली दबाव के ज़्यादा करीब है।

संबंधित प्रश्न

← और देखें: भूमिका और विषय के अनुसार इंटरव्यू प्रश्न