À quelles questions d’entretien Databricks dois-je m’attendre ?

Par Aaron Cao · Mis à jour le

À quelles questions d’entretien Databricks dois-je m’attendre ?
Attendez-vous à quatre groupes : Delta Lake (journal des transactions, garanties ACID, voyage dans le temps, MERGE), l’architecture médaillon (couches bronze, argent et or), Spark sur Databricks (partitions, mélanges, mise en cache, dimensionnement des clusters) et la gouvernance (Unity Catalog, espaces de travail, tâches). Les mises en situation vous confrontent à un pipeline lent ou défaillant et évaluent votre démarche d’investigation.

Attendez-vous à quatre groupes : Delta Lake (journal des transactions, garanties ACID, voyage dans le temps, MERGE), l’architecture médaillon (couches bronze, argent et or), Spark sur Databricks (partitions, mélanges, mise en cache, dimensionnement des clusters) et la gouvernance (Unity Catalog, espaces de travail, tâches). Les mises en situation vous confrontent à un pipeline lent ou défaillant et évaluent votre démarche d’investigation.

Quelles questions sur Delta Lake sont posées en premier ?

Les entretiens Databricks commencent par Delta Lake, car la plateforme repose dessus. Soyez prêt à expliquer ce qu’une table Delta apporte par rapport à de simples fichiers Parquet : un journal des transactions qui consigne chaque validation, permettant des écritures atomiques, des lectures cohérentes et l’interrogation d’une table telle qu’elle existait dans une version antérieure. La suite des questions est prévisible : le fonctionnement du voyage dans le temps (lecture d’un instantané antérieur du journal), ce que VACUUM supprime et pourquoi cela limite jusqu’où il est possible de remonter, ainsi que la façon dont MERGE met en œuvre les upserts et les modèles de capture des modifications de données.

  • Application et évolution du schéma. Les écritures qui ne correspondent pas au schéma sont rejetées, sauf si son évolution est activée ; précisez quand vous l’autoriseriez.
  • OPTIMIZE et organisation des fichiers. Les petits fichiers nuisent aux performances de lecture ; la compaction les réécrit, tandis que le clustering ou l’ordonnancement en Z regroupent les valeurs sur lesquelles portent les filtres des requêtes.
  • Streaming et traitement par lots sur une même table. Une même table Delta peut servir de destination de streaming et de source pour le traitement par lots ; expliquez ce que signifie le traitement « exactement une fois » pour une tâche Structured Streaming qui écrit dans Delta.
  • Delta Live Tables et pipelines. Des pipelines déclaratifs assortis d’attentes en matière de qualité des données ; soyez prêt à expliquer ce que fait une attente lorsqu’une ligne ne la satisfait pas.

Répondez en décrivant le mécanisme. Dire que Delta est ACID est le slogan ; expliquer que le journal des transactions rend une écriture partiellement échouée invisible aux lecteurs est la réponse.

Comment se présentent les questions sur l’architecture médaillon et les pipelines ?

Vous avez construit des couches bronze, argent et or, et vous soupçonnez que l’intervieweur attend davantage que leurs noms. Vous avez raison : cette section présente donc la logique de conception de chaque couche et les questions qui servent à l’évaluer.

  • Bronze. Ingestion brute, ajout uniquement, schéma tel qu’il est arrivé. Question suivante : pourquoi conserver les données brutes si la couche argent est plus propre ? Pour le retraitement et l’audit.
  • Argent. Enregistrements nettoyés, dédupliqués et harmonisés. Question suivante : comment dédupliquer un flux d’événements susceptibles d’arriver en retard ou deux fois, et quel rôle joue le filigrane ?
  • Or. Agrégats et tables métier destinés aux analystes et aux tableaux de bord. Question suivante : qui est responsable des définitions et comment empêcher deux tables or de présenter des chiffres d’affaires contradictoires ?
  • Orchestration. Tâches, dépendances entre tâches, nouvelles tentatives et alertes. Question suivante : comment rendre une tâche idempotente afin qu’une nouvelle exécution ne provoque pas de double comptage ?
  • Ingestion. Auto Loader pour la découverte incrémentielle des fichiers, et raisons pour lesquelles un simple listage de répertoire ne passe pas à l’échelle.

Les intervieweurs posent également des questions sur les coûts : pourquoi un cluster polyvalent ne convient pas à une tâche planifiée, quand choisir un cluster de tâches ou un calcul serverless, et comment la mise à l’échelle automatique et les instances ponctuelles influencent la facture. Énoncez la contrainte, choisissez le mécanisme et indiquez le coût.

Quelles questions préparer sur le réglage de Spark et les mises en situation ?

Dans les entretiens pour profils expérimentés, on vous présente un symptôme. Exemple représentatif : un ingénieur des données candidatant à un poste lié à une plateforme dans une entreprise de vente au détail apprend qu’une tâche nocturne joignant les commandes à une dimension client est passée de quelques minutes à plusieurs heures après une forte croissance des données. Une bonne réponse commence par le plan de requête et l’interface de Spark plutôt que par un cluster plus puissant : elle vérifie si la jointure est devenue une jointure avec mélange au lieu d’une diffusion, si quelques clés sont déséquilibrées, si le nombre de partitions de mélange correspond toujours au volume des données et si les tables sources souffrent d’un problème de petits fichiers que OPTIMIZE corrigerait. L’intervieweur évalue l’ordre de votre investigation.

Autres scénarios récurrents : une tâche de streaming dont le retard ne cesse d’augmenter et l’interaction entre les intervalles de déclenchement, la taille de l’état et les filigranes ; un notebook qui fonctionne pour un utilisateur mais échoue pour un autre, généralement en raison d’un problème d’autorisations menant à Unity Catalog, aux espaces de travail et aux principaux de service ; une table que les analystes jugent obsolète, ce qui soulève une question d’actualisation et d’orchestration ; et une demande visant à exposer des données de manière sécurisée à une autre équipe, cas dans lequel interviennent Delta Sharing et les autorisations au niveau du catalogue.

Entraînez-vous à répondre à voix haute aux questions de suivi avant le véritable appel ; le mode entretien blanc est conçu pour les mises en situation, et l’ensemble plus vaste de banques de questions sur les données et l’ingénierie se trouve sous questions d’entretien par poste et par sujet.

Un assistant d’entretien IA peut-il aider avec les questions Databricks ?

Lors des entretiens conversationnels, oui, dans certaines limites clairement établies. L’application de bureau native de SubcueAI pour macOS et Windows capte le son du système et votre microphone, puis affiche de courtes suggestions de réponse dans une superposition locale. Ainsi, lorsque l’intervieweur vous demande le rôle d’un filigrane dans la déduplication d’un flux, le mécanisme apparaît à l’écran pendant que vous l’expliquez avec vos propres mots. L’extension de navigateur prend en charge les appels dans un onglet sur Chrome et Edge en captant uniquement le son de l’onglet de la réunion. Aucun bot ne rejoint l’appel et rien n’est injecté dans la page de réunion ; la procédure de configuration se trouve sur la page du tutoriel.

Les limites : une évaluation supervisée, un écran enregistré, un ordinateur portable géré par l’entreprise ou un exercice en direct sur notebook au cours duquel vous écrivez du PySpark sous surveillance sont hors périmètre, alors que les entretiens Databricks y placent souvent leur partie la plus difficile. L’assistant est surtout efficace pour les questions d’architecture et de compromis. Importez d’abord votre CV afin que les suggestions correspondent aux pipelines que vous avez réellement construits ; le créateur de CV conserve ce profil.

FAQ

Qu’apporte Delta Lake par rapport à Parquet ?

Un journal des transactions ajouté aux fichiers Parquet. Ce journal fournit des validations atomiques, des lectures cohérentes pendant les écritures, l’application du schéma, les upserts avec MERGE et le voyage dans le temps vers des versions antérieures de la table.

Qu’est-ce que l’architecture médaillon ?

Une conception en couches : bronze conserve les données brutes ingérées, argent les enregistrements nettoyés et harmonisés, et or les agrégats destinés aux usages métier. Chaque couche constitue un contrat de qualité permettant aux utilisateurs de savoir quels traitements ont ou n’ont pas été appliqués aux données.

Comment accélérer une jointure Spark lente sur Databricks ?

Commencez par lire le plan de requête. Vérifiez si une petite table peut être diffusée, si quelques clés sont déséquilibrées, si le nombre de partitions de mélange convient aux données et si de petits fichiers ou l’absence de clustering ralentissent l’analyse. N’envisagez qu’ensuite un cluster plus puissant.

À quoi sert Unity Catalog ?

À centraliser la gouvernance entre les espaces de travail : une hiérarchie de catalogues, schémas et tables assortie de contrôles d’accès, d’un suivi de la traçabilité et d’audits, définie une seule fois plutôt que pour chaque cluster ou notebook.

SubcueAI peut-il m’aider pendant un exercice Databricks supervisé sur notebook ?

Non. Les évaluations supervisées et enregistrées sont hors périmètre, et le code écrit sous surveillance doit être votre propre travail. SubcueAI est conçu pour les entretiens conversationnels, que vous pouvez préparer avec le mode entretien blanc.

Questions liées

← Plus sur Questions d’entretien par poste et par thème