Mga Tanong sa Panayam ng Data Engineer, ayon sa Round
Ni Aaron Cao · Na-update noong

Sinasaklaw ng mga loop ng data engineer ang advanced SQL, data modelling, disenyo ng pipeline at ETL, distributed processing, at mga behavioral round. Ang pipeline design round ang nagpapasya sa karamihan ng resulta: tinatanong nito kung paano mo hinahawakan ang late data, reruns, at failures, hindi kung anong tool ang gusto mo.
Anong mga round ang bumubuo sa loop ng data engineer?
Baka naghahanda ka sa parehong paraan gaya ng paghahanda para sa loop ng software engineering, at nagtataka kung ano ang kaibahan. Ipinapakita ng seksyong ito ang mga round na paulit-ulit gamitin ng mga panayam na ito, para magamit mo ang oras mo sa dalawang round na talagang naghihiwalay sa mga kandidato. Bihirang doon nawawala ang mga job offer sa technical filter.
- SQL. Window functions, deduplication, at query performance, kadalasan live.
- Data modelling. Pagdidisenyo ng mga table para sa isang inilarawang negosyo, at pagtatanggol sa grain na pinili mo.
- Disenyo ng pipeline at ETL. Isang open ended system design round na nakatuon sa paggalaw ng data.
- Distributed processing. Paano talaga isinasagawa ng isang framework ang trabaho mo, at bakit ito mabagal.
- Coding. Python o Scala, kadalasan mas magaan kaysa sa round ng software engineering.
- Behavioral. Mga on call incident, sirang dashboard, at mga stakeholder na gustong makuha ang numero kahapon pa.
Malaki ang pagkakapatong ng mga titulo sa analytics engineering at mga platform role, kaya nagbabago ang timpla. Matatagpuan ang mga kaugnay na role bank sa interview questions by role hub.
Anong mga tanong sa SQL at data modelling ang lumalabas?
SQL
- Mag-deduplicate ng table na iiwan lang ang pinakabagong row bawat key.
- Sumulat ng query na nagbabalik ng bilang ng session ng bawat user gamit ang 30 minutong inactivity gap.
- Mag-compute ng running total at month over month na pagbabago sa isang query.
- Hanapin ang mga row na nasa snapshot kahapon pero wala na ngayon.
- Ano ang ginagawa ng
QUALIFY, at ano ang isusulat mo kung wala ito? - Nag-scan ang query na ito ng bilyong row at umaabot ng twenty minutes. Paano mo ito susuriin?
- Ipaliwanag ang pagkakaiba ng partitioning at clustering, at kailan tumutulong ang bawat isa.
Data modelling
- Idisenyo ang mga table para sa order history ng isang online marketplace. Ano ang grain ng fact table mo?
- Ipaliwanag ang star schema, at kailan mo sadyang gagawin pang mas denormalized.
- Ano ang slowly changing dimension, at paano mo ipatutupad ang type two?
- Gusto ng isang stakeholder na sumalamin ang historical reporting sa kasalukuyang region ng customer. Ano ang masisira?
- Paano mo ididisenyo ang isang event stream na dumarating na out of order?
- Kailan ka pipili ng wide table sa halip na normalized model?
Ginagantimpalaan ng modelling round ang pagpili ng grain at ang pagtatanggol dito. Mas mababa ang score ng mga kandidatong naglalarawan ng tatlong posibleng disenyo nang hindi pumipili kaysa sa mga kandidatong pumipili ng makatwirang disenyo at binabanggit ang kahinaan nito.
Anong mga tanong sa pipeline at distributed processing ang lumalabas?
Disenyo ng pipeline at ETL
- Idisenyo ang isang pipeline na nagloload ng pang-araw-araw na transaksyon papunta sa warehouse para sa reporting.
- Muling ipinadala ng upstream source ang data ng kahapon. Ano ang mangyayari sa trabaho mo?
- Paano mo gagawing idempotent ang isang pipeline, at bakit ito mahalaga para sa reruns?
- Paano ka magba-backfill ng dalawang taong history nang hindi naaabala ang pang-araw-araw na load?
- Lumabas ang late arriving data tatlong araw pagkatapos magsara ang partition. Ano ang gagawin mo?
- Paano mo mababatid na nagtagumpay ang isang pipeline pero mali ang nabuong data?
- Ano ang minomonitor mo, at ano ang nagpapa-page sa isang tao nang alas tres ng umaga?
Distributed processing at streaming
- Ano ang nagdudulot ng shuffle, at bakit ito magastos?
- Mabagal ang trabaho mo at may isang task na mas matagal pa kaysa sa iba. Ano ang nangyayari?
- Ipaliwanag ang data skew at dalawang paraan para hawakan ito.
- Kailan ka pipili ng streaming kaysa sa naka-iskedyul na batch job?
- Ano talaga ang ginagarantiya ng exactly once processing, at saan ito hindi umiiral?
- Paano hinahawakan ng watermarks ang out of order events sa isang windowed aggregation?
Pansinin kung gaano kakaunti dito ang nagtatanong sa iyo na magbanggit ng tool. Ang pagbanggit ng isa ay simula lang ng sagot, hindi ang sagot mismo. Palaging sumusunod kung bakit, at ano ang masisira.
Paano mo dapat pagsanayan ang mga ito?
Nagtuturo ng recognition ang pagbabasa ng mga listahang ito. Ibang bagay ang sinusubok ng design round: ang pagpapanatili ng isang system sa isip mo habang may nangungulit sa iyo ng failure case. Doon lang manggagaling ang husay na iyon, sa pagsasalita ng disenyo nang malakas.
- Iguhit at ilarawan ang isang pipeline sa loob ng fifteen minutes. Source, landing, transform, serve, dagdag pa kung paano nabibigo ang bawat stage.
- Salakayin ang sarili mong disenyo. Pagkatapos ng bawat practice run, itanong kung ano ang mangyayari sa rerun, sa late data, at sa pagbabago ng schema.
- Maghanda ng numero para sa scale. Row bawat araw, laki, latency budget. Ang paglalahad ng ipinapalagay mong scale muna ay iskoradong bagay.
- Isulat ang SQL nang manu-mano. Kadalasang gumagamit ang live round ng plain editor na walang autocomplete at walang execution.
- Pagsanayin nang maayos ang isang kwento ng insidente. Ano ang nasira, paano mo ito natuklasan, ano ang binago mo para hindi na ito maulit.
Isang data engineer na may six years na karanasan sa batch pipelines ang naghanda sa pamamagitan ng pagsusuri ng mga internals ng framework, pero natigil siya sa "muling ipinadala ng upstream source ang file kahapon" dahil siya lang mismo ang laging humahawak nito nang manu-mano, hindi niya ito kailanman ipinaliwanag. Nandoon ang kaalaman; wala ang sinabing sagot. Ang pagsasanay sa design round kasama ang mga follow-up ang layunin ng mock interview mode.
FAQ
Paano naiiba ang panayam ng data engineer sa panayam ng software engineer?
Kailangan ko ba talaga ng Spark, o sapat na ang konsepto?
Gaano kalaki ang data modelling na sinusubok ng mga panayam na ito?
Ano ang pinakakaraniwang dahilan kung bakit nabibigo ang mga kandidato sa loop ng data engineer?
Paano ako magsasanay ng design round nang mag-isa?
Kaugnay na tanong
- Anong mga tanong ang itinatanong sa interview ng data scientist?
- Anong mga tanong ang itinatanong sa interview ng data analyst?
- Anong mga tanong ang itinatanong sa interview ng product manager?
- Anong mga tanong tungkol sa Copilot at AI coding assistant ang natatanggap ng mga developer sa panayam?
- Anong mga tanong ang itinatanong sa ikalawang interview?
- Anong mga tanong ang itinatanong sa isang AI interview?