Mit welchen Databricks-Interviewfragen sollte ich rechnen?

Von Aaron Cao · Aktualisiert am

Mit welchen Databricks-Interviewfragen sollte ich rechnen?
Rechnen Sie mit vier Gruppen: Delta Lake (Transaktionsprotokoll, ACID-Garantien, Zeitreisen, MERGE), die Medallion-Architektur (Bronze-, Silber- und Gold-Schichten), Spark auf Databricks (Partitionen, Shuffles, Caching, Cluster-Dimensionierung) und Governance (Unity Catalog, Workspaces, Jobs). Bei Szenariofragen erhalten Sie eine langsame oder fehlerhafte Pipeline, und Ihr Vorgehen bei der Untersuchung wird bewertet.

Rechnen Sie mit vier Gruppen: Delta Lake (Transaktionsprotokoll, ACID-Garantien, Zeitreisen, MERGE), die Medallion-Architektur (Bronze-, Silber- und Gold-Schichten), Spark auf Databricks (Partitionen, Shuffles, Caching, Cluster-Dimensionierung) und Governance (Unity Catalog, Workspaces, Jobs). Bei Szenariofragen erhalten Sie eine langsame oder fehlerhafte Pipeline, und Ihr Vorgehen bei der Untersuchung wird bewertet.

Welche Fragen zu Delta Lake kommen zuerst?

Databricks-Interviews beginnen mit Delta Lake, weil die Plattform darauf aufbaut. Sie sollten erklären können, was eine Delta-Tabelle gegenüber einfachen Parquet-Dateien ergänzt: ein Transaktionsprotokoll, das jeden Commit erfasst und dadurch atomare Schreibvorgänge, konsistente Lesevorgänge und die Abfrage einer Tabelle in einer früheren Version ermöglicht. Die anschließende Fragenfolge ist vorhersehbar: wie Zeitreisen funktionieren (Lesen eines früheren Schnappschusses des Protokolls), was VACUUM entfernt und weshalb dies begrenzt, wie weit Sie zurückreisen können, sowie wie MERGE Upserts und Muster für Change Data Capture implementiert.

  • Schemaerzwingung und Schemaentwicklung. Schreibvorgänge, die nicht dem Schema entsprechen, werden abgelehnt, sofern die Weiterentwicklung nicht aktiviert ist; erklären Sie, wann Sie sie zulassen würden.
  • OPTIMIZE und Dateianordnung. Kleine Dateien beeinträchtigen die Leseleistung; bei der Komprimierung werden sie neu geschrieben, während Clustering oder Z-Ordering Werte zusammen anordnet, nach denen Abfragen filtern.
  • Streaming und Batch auf einer Tabelle. Dieselbe Delta-Tabelle kann als Streaming-Ziel und Batch-Quelle dienen; erklären Sie, was genau einmalige Verarbeitung für einen Structured-Streaming-Job bedeutet, der in Delta schreibt.
  • Delta Live Tables und Pipelines. Deklarative Pipelines mit Erwartungen an die Datenqualität; erklären Sie, was eine Erwartung bewirkt, wenn eine Zeile sie nicht erfüllt.

Antworten Sie mit dem Mechanismus. Dass Delta ACID-konform ist, ist der Slogan; dass das Transaktionsprotokoll einen teilweise fehlgeschlagenen Schreibvorgang für Leser unsichtbar macht, ist die Antwort.

Wie laufen Fragen zur Medallion-Architektur und zum Pipeline-Design ab?

Sie haben Bronze-, Silber- und Gold-Schichten aufgebaut und vermuten, dass der Interviewer mehr als nur die Namen hören möchte. Das stimmt, daher erläutert dieser Abschnitt die Designüberlegungen hinter jeder Schicht und die Fragen, mit denen sie geprüft werden.

  • Bronze. Rohdatenerfassung, nur Anhängen, Schema wie eingegangen. Nachfrage: Warum Rohdaten überhaupt behalten, wenn Silber sauberer ist? Neuverarbeitung und Auditierung.
  • Silber. Bereinigte, deduplizierte und vereinheitlichte Datensätze. Nachfrage: Wie deduplizieren Sie einen Ereignisstrom, dessen Ereignisse verspätet oder doppelt eintreffen können, und welche Rolle spielt dabei Watermarking?
  • Gold. Aggregate und Tabellen auf Geschäftsebene für Analysten und Dashboards. Nachfrage: Wer ist für die Definitionen verantwortlich, und wie verhindern Sie, dass zwei Gold-Tabellen beim Umsatz voneinander abweichen?
  • Orchestrierung. Jobs, Aufgabenabhängigkeiten, Wiederholungsversuche und Warnmeldungen. Nachfrage: Wie machen Sie einen Job idempotent, damit eine erneute Ausführung nicht doppelt zählt?
  • Datenerfassung. Auto Loader für die inkrementelle Dateierkennung und die Frage, warum eine naive Verzeichnisauflistung nicht skaliert.

Interviewer fragen auch nach den Kosten: warum ein Allzweck-Cluster der falsche Ort für einen geplanten Job ist, wann ein Job-Cluster oder serverloses Computing passt und wie Autoscaling und Spot-Instanzen die Rechnung verändern. Nennen Sie die Einschränkung, wählen Sie den Mechanismus und beziffern Sie die Kosten.

Auf welche Spark-Optimierungs- und Szenariofragen sollte ich mich vorbereiten?

In Interviewrunden für erfahrene Kandidaten erhalten Sie ein Symptom. Ein typisches Beispiel: Ein Data Engineer bewirbt sich bei einem Einzelhandelsunternehmen auf eine Plattformrolle und erfährt, dass ein nächtlicher Job, der Bestellungen mit einer Kundendimension verknüpft, nach starkem Datenwachstum statt Minuten nun Stunden benötigt. Eine gute Antwort beginnt mit dem Abfrageplan und der Spark UI statt mit einem größeren Cluster: Sie prüft, ob aus dem Join ein Shuffle Join statt eines Broadcast Join geworden ist, ob einige wenige Schlüssel einen Skew verursachen, ob die Anzahl der Shuffle-Partitionen noch zur Datenmenge passt und ob die Quelltabellen Probleme mit kleinen Dateien haben, die OPTIMIZE beheben würde. Der Interviewer bewertet die Reihenfolge Ihrer Untersuchung.

Weitere wiederkehrende Szenarien: ein Streaming-Job, dessen Verzögerung ständig wächst, und das Zusammenspiel von Trigger-Intervallen, Zustandsgröße und Watermarks; ein Notebook, das für einen Benutzer funktioniert und für einen anderen fehlschlägt, was gewöhnlich eine Berechtigungsfrage ist, die zu Unity Catalog, Workspaces und Dienstprinzipalen führt; eine Tabelle, die Analysten als veraltet bemängeln, was eine Frage zu Aktualität und Orchestrierung ist; und die Anforderung, Daten einem anderen Team sicher bereitzustellen, wobei Delta Sharing und Berechtigungen auf Katalogebene ins Spiel kommen.

Üben Sie diese Szenarien vor dem echten Gespräch laut und mit Nachfragen; der Modus Probeinterview ist für Szenariofragen gedacht, und die umfassendere Sammlung für Daten- und Engineering-Rollen finden Sie unter Interviewfragen nach Rolle und Thema.

Kann ein KI-Interviewassistent bei Databricks-Fragen helfen?

In Gesprächsrunden ja, allerdings mit klaren Grenzen. Die native Desktop-App von SubcueAI für macOS und Windows erfasst Systemaudio und Ihr Mikrofon und zeigt kurze Antwortvorschläge in einer lokalen Einblendung an. Fragt der Interviewer also, was ein Watermark bei der Deduplizierung eines Datenstroms bewirkt, sehen Sie den Mechanismus auf Ihrem Bildschirm, während Sie ihn mit eigenen Worten erklären. Die Browsererweiterung unterstützt Anrufe in Browser-Tabs unter Chrome und Edge, indem sie ausschließlich den Ton des Meeting-Tabs erfasst. Kein Bot tritt dem Anruf bei, und nichts wird in die Meeting-Seite eingeschleust; die Anleitung zur Einrichtung finden Sie auf der Seite Tutorial.

Die Grenzen: Eine beaufsichtigte Prüfung, eine Bildschirmaufzeichnung, ein vom Unternehmen verwalteter Laptop oder eine Live-Notebook-Aufgabe, bei der Sie unter Beobachtung PySpark schreiben, liegen außerhalb des Einsatzbereichs – und genau dort befindet sich bei Databricks-Interviews häufig der schwierigste Teil. Der Assistent eignet sich am besten für Fragen zu Architektur und Abwägungen. Laden Sie zuerst Ihren Lebenslauf hoch, damit die Vorschläge die Pipelines widerspiegeln, die Sie tatsächlich erstellt haben; im Lebenslauf-Builder wird dieses Profil gespeichert.

FAQ

Was ergänzt Delta Lake gegenüber Parquet?

Ein Transaktionsprotokoll über den Parquet-Dateien. Dieses Protokoll ermöglicht atomare Commits, konsistente Lesevorgänge während laufender Schreibvorgänge, Schemaerzwingung, Upserts mit MERGE und Zeitreisen zu früheren Versionen der Tabelle.

Was ist die Medallion-Architektur?

Ein Schichtenmodell: Bronze enthält rohe erfasste Daten, Silber enthält bereinigte und vereinheitlichte Datensätze, Gold enthält Aggregate für geschäftliche Zwecke. Jede Schicht ist ein Qualitätsvertrag, sodass Verbraucher wissen, was mit den Daten bereits geschehen ist und was nicht.

Wie beschleunigen Sie einen langsamen Spark Join auf Databricks?

Lesen Sie zuerst den Abfrageplan. Prüfen Sie, ob eine kleine Tabelle per Broadcast verteilt werden könnte, ob einige wenige Schlüssel einen Skew verursachen, ob die Anzahl der Shuffle-Partitionen zu den Daten passt und ob kleine Dateien oder fehlendes Clustering den Scan verlangsamen. Erwägen Sie erst danach einen größeren Cluster.

Wozu dient Unity Catalog?

Zentralisierte Governance über Workspaces hinweg: eine Hierarchie aus Katalog, Schema und Tabelle mit Zugriffskontrolle, Datenherkunft und Auditierung, die einmal zentral statt für jeden Cluster oder jedes Notebook definiert wird.

Kann SubcueAI bei einer beaufsichtigten Databricks-Notebook-Aufgabe helfen?

Nein. Beaufsichtigte und aufgezeichnete Prüfungen liegen außerhalb des Einsatzbereichs, und das Programmieren unter Beobachtung ist Ihre eigene Arbeit. Der Assistent ist für Gesprächsrunden gedacht, die Sie im Probeinterview-Modus üben können.

Verwandte Fragen

← Mehr zu Interviewfragen nach Rolle & Thema