Jaké otázky mohu očekávat u pohovoru na Databricks?
Autor: Aaron Cao · Aktualizováno

Očekávejte čtyři skupiny: Delta Lake (transakční protokol, záruky ACID, cestování v čase, MERGE), medailonovou architekturu (bronzová, stříbrná a zlatá vrstva), Spark na Databricks (oddíly, přeskupování dat, ukládání do mezipaměti, dimenzování clusteru) a správu dat (Unity Catalog, pracovní prostory, úlohy). Ve scénářových otázkách dostanete pomalou nebo selhávající pipeline a hodnotí se váš postup při hledání příčiny.
Které otázky o Delta Lake přicházejí jako první?
Pohovory na Databricks začínají tématem Delta Lake, protože na něm stojí celá platforma. Připravte se vysvětlit, co tabulka Delta přidává oproti obyčejným souborům Parquet: transakční protokol zaznamenávající každé potvrzení, který zajišťuje atomické zápisy, konzistentní čtení a možnost dotazovat se na tabulku v podobě, jakou měla v dřívější verzi. Následující otázky lze předvídat: jak funguje cestování v čase (načtení dřívějšího snímku protokolu), co odstraňuje VACUUM a proč tím omezuje, jak hluboko do minulosti se lze vrátit, a jak MERGE implementuje operace upsert a postupy zaznamenávání změn dat.
- Vynucování a vývoj schématu. Zápisy, které neodpovídají schématu, jsou odmítnuty, pokud není povolen jeho vývoj; vysvětlete, kdy byste ho povolili.
- OPTIMIZE a rozložení souborů. Malé soubory zhoršují výkon čtení; kompakce je přepisuje a clustering nebo Z-ordering ukládá blízko sebe hodnoty, podle nichž dotazy filtrují.
- Streamování a dávkové zpracování nad jednou tabulkou. Stejná tabulka Delta může být cílem streamu i zdrojem dávkového zpracování; vysvětlete, co přesně znamená zpracování právě jednou u úlohy Structured Streaming zapisující do Delty.
- Delta Live Tables a pipeline. Deklarativní pipeline s očekáváními kvality dat; připravte se popsat, co očekávání udělá, když je řádek nesplní.
Odpovězte popisem mechanismu. Tvrzení, že Delta podporuje ACID, je slogan; skutečnou odpovědí je, že transakční protokol skryje před čtenáři částečně neúspěšný zápis.
Jak probíhají otázky o medailonové architektuře a návrhu pipeline?
Vybudovali jste bronzovou, stříbrnou a zlatou vrstvu a tušíte, že tazatel chce slyšet víc než jen jejich názvy. Máte pravdu, proto tato část uvádí důvody návrhu jednotlivých vrstev a otázky, které je prověřují.
- Bronzová. Nezpracovaný příjem dat, pouze přidávání, schéma v podobě, v jaké dorazilo. Doplňující otázka: proč vůbec uchovávat nezpracovaná data, když je stříbrná vrstva čistší? Kvůli opětovnému zpracování a auditu.
- Stříbrná. Vyčištěné, deduplikované a sjednocené záznamy. Doplňující otázka: jak deduplikujete stream událostí, které mohou dorazit pozdě nebo dvakrát, a jakou roli v tom hrají vodoznaky?
- Zlatá. Agregace a tabulky na obchodní úrovni určené analytikům a řídicím panelům. Doplňující otázka: kdo vlastní definice a jak zabráníte tomu, aby si dvě zlaté tabulky odporovaly v údajích o tržbách?
- Orchestrace. Úlohy, závislosti mezi úkoly, opakované pokusy a upozornění. Doplňující otázka: jak zajistíte idempotenci úlohy, aby opakované spuštění nezapočítalo data dvakrát?
- Příjem dat. Auto Loader pro průběžné zjišťování souborů a vysvětlení, proč se naivní výpis adresáře nedá škálovat.
Tazatelé se ptají také na náklady: proč není univerzální cluster vhodným místem pro naplánovanou úlohu, kdy se hodí cluster úlohy nebo bezserverový výpočetní výkon a jak automatické škálování a spot instance mění účet. Uveďte omezení, zvolte mechanismus a pojmenujte náklad.
Na jaké otázky o ladění Sparku a scénáře se mám připravit?
V pohovorech na seniorní pozice dostanete příznak problému. Typický příklad: datový inženýr ucházející se o pozici v platformovém týmu maloobchodní společnosti se dozví, že noční úloze spojující objednávky s dimenzí zákazníků po prudkém nárůstu dat trvá běh místo minut celé hodiny. Silná odpověď nezačne větším clusterem, ale plánem dotazu a rozhraním Spark UI: prověří, zda se spojení nezměnilo z broadcast joinu na shuffle join, zda několik klíčů nezpůsobuje zešikmení dat, zda počet oddílů pro přeskupování stále odpovídá objemu dat a zda zdrojové tabulky nemají problém s malými soubory, který by vyřešil OPTIMIZE. Tazatel hodnotí pořadí vyšetřování.
Další opakující se scénáře: streamovací úloha se stále větším zpožděním a souvislost intervalů spouštění, velikosti stavu a vodoznaků; notebook, který jednomu uživateli funguje a jinému ne, což bývá problém oprávnění vedoucí k tématům Unity Catalog, pracovních prostorů a instančních objektů; tabulka, na jejíž zastaralost si stěžují analytici, což je otázka aktuálnosti a orchestrace; a požadavek na bezpečné zpřístupnění dat jinému týmu, kde přicházejí na řadu Delta Sharing a oprávnění na úrovni katalogu.
Před skutečným hovorem si tyto scénáře nacvičte nahlas i s doplňujícími otázkami; režim simulovaného pohovoru je určen pro scénářové otázky a širší soubor databází otázek pro datové a technické pozice najdete v části otázky k pohovoru podle role a tématu.
Může AI asistent pomoci s otázkami o Databricks?
V konverzačních kolech ano, ovšem s jasnými omezeními. Nativní desktopová aplikace SubcueAI pro macOS a Windows zachycuje systémový zvuk i váš mikrofon a zobrazuje stručné návrhy odpovědí v místním překryvném okně. Když se tedy tazatel zeptá, co dělá vodoznak při deduplikaci streamu, máte mechanismus na obrazovce a můžete ho vysvětlit vlastními slovy. Rozšíření prohlížeče pokrývá hovory na kartě v prohlížečích Chrome a Edge tím, že zachycuje pouze zvuk karty se schůzkou. K hovoru se nepřipojuje žádný bot a do stránky schůzky se nic nevkládá; postup nastavení najdete na stránce s návodem.
Omezení: test v kontrolovaném prostředí, nahrávání obrazovky, firemně spravovaný notebook nebo praktické cvičení v živém notebooku, při němž pod dohledem píšete v PySpark, jsou mimo rozsah použití, a právě sem pohovory na Databricks často umisťují svou nejtěžší část. Asistent nejlépe pomáhá s otázkami o architektuře a kompromisech. Nejprve nahrajte svůj životopis, aby návrhy odpovídaly pipeline, které jste skutečně vybudovali; tento profil uchovává nástroj pro tvorbu životopisu.