Jaké otázky mohu očekávat u pohovoru na Databricks?

Autor: Aaron Cao · Aktualizováno

Jaké otázky mohu očekávat u pohovoru na Databricks?
Očekávejte čtyři skupiny: Delta Lake (transakční protokol, záruky ACID, cestování v čase, MERGE), medailonovou architekturu (bronzová, stříbrná a zlatá vrstva), Spark na Databricks (oddíly, přeskupování dat, ukládání do mezipaměti, dimenzování clusteru) a správu dat (Unity Catalog, pracovní prostory, úlohy). Ve scénářových otázkách dostanete pomalou nebo selhávající pipeline a hodnotí se váš postup při hledání příčiny.

Očekávejte čtyři skupiny: Delta Lake (transakční protokol, záruky ACID, cestování v čase, MERGE), medailonovou architekturu (bronzová, stříbrná a zlatá vrstva), Spark na Databricks (oddíly, přeskupování dat, ukládání do mezipaměti, dimenzování clusteru) a správu dat (Unity Catalog, pracovní prostory, úlohy). Ve scénářových otázkách dostanete pomalou nebo selhávající pipeline a hodnotí se váš postup při hledání příčiny.

Které otázky o Delta Lake přicházejí jako první?

Pohovory na Databricks začínají tématem Delta Lake, protože na něm stojí celá platforma. Připravte se vysvětlit, co tabulka Delta přidává oproti obyčejným souborům Parquet: transakční protokol zaznamenávající každé potvrzení, který zajišťuje atomické zápisy, konzistentní čtení a možnost dotazovat se na tabulku v podobě, jakou měla v dřívější verzi. Následující otázky lze předvídat: jak funguje cestování v čase (načtení dřívějšího snímku protokolu), co odstraňuje VACUUM a proč tím omezuje, jak hluboko do minulosti se lze vrátit, a jak MERGE implementuje operace upsert a postupy zaznamenávání změn dat.

  • Vynucování a vývoj schématu. Zápisy, které neodpovídají schématu, jsou odmítnuty, pokud není povolen jeho vývoj; vysvětlete, kdy byste ho povolili.
  • OPTIMIZE a rozložení souborů. Malé soubory zhoršují výkon čtení; kompakce je přepisuje a clustering nebo Z-ordering ukládá blízko sebe hodnoty, podle nichž dotazy filtrují.
  • Streamování a dávkové zpracování nad jednou tabulkou. Stejná tabulka Delta může být cílem streamu i zdrojem dávkového zpracování; vysvětlete, co přesně znamená zpracování právě jednou u úlohy Structured Streaming zapisující do Delty.
  • Delta Live Tables a pipeline. Deklarativní pipeline s očekáváními kvality dat; připravte se popsat, co očekávání udělá, když je řádek nesplní.

Odpovězte popisem mechanismu. Tvrzení, že Delta podporuje ACID, je slogan; skutečnou odpovědí je, že transakční protokol skryje před čtenáři částečně neúspěšný zápis.

Jak probíhají otázky o medailonové architektuře a návrhu pipeline?

Vybudovali jste bronzovou, stříbrnou a zlatou vrstvu a tušíte, že tazatel chce slyšet víc než jen jejich názvy. Máte pravdu, proto tato část uvádí důvody návrhu jednotlivých vrstev a otázky, které je prověřují.

  • Bronzová. Nezpracovaný příjem dat, pouze přidávání, schéma v podobě, v jaké dorazilo. Doplňující otázka: proč vůbec uchovávat nezpracovaná data, když je stříbrná vrstva čistší? Kvůli opětovnému zpracování a auditu.
  • Stříbrná. Vyčištěné, deduplikované a sjednocené záznamy. Doplňující otázka: jak deduplikujete stream událostí, které mohou dorazit pozdě nebo dvakrát, a jakou roli v tom hrají vodoznaky?
  • Zlatá. Agregace a tabulky na obchodní úrovni určené analytikům a řídicím panelům. Doplňující otázka: kdo vlastní definice a jak zabráníte tomu, aby si dvě zlaté tabulky odporovaly v údajích o tržbách?
  • Orchestrace. Úlohy, závislosti mezi úkoly, opakované pokusy a upozornění. Doplňující otázka: jak zajistíte idempotenci úlohy, aby opakované spuštění nezapočítalo data dvakrát?
  • Příjem dat. Auto Loader pro průběžné zjišťování souborů a vysvětlení, proč se naivní výpis adresáře nedá škálovat.

Tazatelé se ptají také na náklady: proč není univerzální cluster vhodným místem pro naplánovanou úlohu, kdy se hodí cluster úlohy nebo bezserverový výpočetní výkon a jak automatické škálování a spot instance mění účet. Uveďte omezení, zvolte mechanismus a pojmenujte náklad.

Na jaké otázky o ladění Sparku a scénáře se mám připravit?

V pohovorech na seniorní pozice dostanete příznak problému. Typický příklad: datový inženýr ucházející se o pozici v platformovém týmu maloobchodní společnosti se dozví, že noční úloze spojující objednávky s dimenzí zákazníků po prudkém nárůstu dat trvá běh místo minut celé hodiny. Silná odpověď nezačne větším clusterem, ale plánem dotazu a rozhraním Spark UI: prověří, zda se spojení nezměnilo z broadcast joinu na shuffle join, zda několik klíčů nezpůsobuje zešikmení dat, zda počet oddílů pro přeskupování stále odpovídá objemu dat a zda zdrojové tabulky nemají problém s malými soubory, který by vyřešil OPTIMIZE. Tazatel hodnotí pořadí vyšetřování.

Další opakující se scénáře: streamovací úloha se stále větším zpožděním a souvislost intervalů spouštění, velikosti stavu a vodoznaků; notebook, který jednomu uživateli funguje a jinému ne, což bývá problém oprávnění vedoucí k tématům Unity Catalog, pracovních prostorů a instančních objektů; tabulka, na jejíž zastaralost si stěžují analytici, což je otázka aktuálnosti a orchestrace; a požadavek na bezpečné zpřístupnění dat jinému týmu, kde přicházejí na řadu Delta Sharing a oprávnění na úrovni katalogu.

Před skutečným hovorem si tyto scénáře nacvičte nahlas i s doplňujícími otázkami; režim simulovaného pohovoru je určen pro scénářové otázky a širší soubor databází otázek pro datové a technické pozice najdete v části otázky k pohovoru podle role a tématu.

Může AI asistent pomoci s otázkami o Databricks?

V konverzačních kolech ano, ovšem s jasnými omezeními. Nativní desktopová aplikace SubcueAI pro macOS a Windows zachycuje systémový zvuk i váš mikrofon a zobrazuje stručné návrhy odpovědí v místním překryvném okně. Když se tedy tazatel zeptá, co dělá vodoznak při deduplikaci streamu, máte mechanismus na obrazovce a můžete ho vysvětlit vlastními slovy. Rozšíření prohlížeče pokrývá hovory na kartě v prohlížečích Chrome a Edge tím, že zachycuje pouze zvuk karty se schůzkou. K hovoru se nepřipojuje žádný bot a do stránky schůzky se nic nevkládá; postup nastavení najdete na stránce s návodem.

Omezení: test v kontrolovaném prostředí, nahrávání obrazovky, firemně spravovaný notebook nebo praktické cvičení v živém notebooku, při němž pod dohledem píšete v PySpark, jsou mimo rozsah použití, a právě sem pohovory na Databricks často umisťují svou nejtěžší část. Asistent nejlépe pomáhá s otázkami o architektuře a kompromisech. Nejprve nahrajte svůj životopis, aby návrhy odpovídaly pipeline, které jste skutečně vybudovali; tento profil uchovává nástroj pro tvorbu životopisu.

Časté dotazy

Co přidává Delta Lake oproti Parquetu?

Transakční protokol nad soubory Parquet. Tento protokol zajišťuje atomická potvrzení, konzistentní čtení během probíhajících zápisů, vynucování schématu, operace upsert pomocí MERGE a cestování v čase do dřívějších verzí tabulky.

Co je medailonová architektura?

Vrstvený návrh: bronzová vrstva uchovává přijatá nezpracovaná data, stříbrná vyčištěné a sjednocené záznamy a zlatá agregace pro obchodní využití. Každá vrstva představuje smlouvu o kvalitě, takže uživatelé vědí, co už s daty bylo a nebylo provedeno.

Jak zrychlit pomalé spojení ve Sparku na Databricks?

Nejprve si přečtěte plán dotazu. Prověřte, zda lze malou tabulku distribuovat jako broadcast, zda několik klíčů nezpůsobuje zešikmení, zda počty oddílů pro přeskupování odpovídají datům a zda čtení nezpomalují malé soubory nebo chybějící clustering. Teprve poté zvažte větší cluster.

K čemu slouží Unity Catalog?

K centralizované správě napříč pracovními prostory: hierarchie katalogu, schématu a tabulky s řízením přístupu, sledováním původu a auditem, která se definuje jednou, nikoli samostatně pro každý cluster nebo notebook.

Může SubcueAI pomoci při notebookovém cvičení na Databricks v kontrolovaném prostředí?

Ne. Testy v kontrolovaném prostředí a nahrávaná hodnocení jsou mimo rozsah použití a programování pod dohledem je vaší vlastní prací. Je určen pro konverzační kola, která si můžete procvičit v režimu simulovaného pohovoru.

Související otázky

← Více o Otázky k pohovoru podle role a tématu