Que perguntas devo esperar em uma entrevista da Databricks?

Por Aaron Cao · Atualizado em

Que perguntas devo esperar em uma entrevista da Databricks?
Espere quatro grupos: Delta Lake (log de transações, garantias ACID, viagem no tempo, MERGE), arquitetura medallion (camadas bronze, silver e gold), Spark no Databricks (partições, shuffles, cache e dimensionamento de clusters) e governança (Unity Catalog, espaços de trabalho e jobs). Nas perguntas situacionais, você recebe um pipeline lento ou com falhas, e sua investigação é avaliada.

Espere quatro grupos: Delta Lake (log de transações, garantias ACID, viagem no tempo, MERGE), arquitetura medallion (camadas bronze, silver e gold), Spark no Databricks (partições, shuffles, cache e dimensionamento de clusters) e governança (Unity Catalog, espaços de trabalho e jobs). Nas perguntas situacionais, você recebe um pipeline lento ou com falhas, e sua investigação é avaliada.

Quais perguntas sobre Delta Lake aparecem primeiro?

As entrevistas da Databricks começam com Delta Lake porque a plataforma é construída sobre ele. Esteja preparado para explicar o que uma tabela Delta acrescenta aos arquivos Parquet comuns: um log de transações que registra cada confirmação, proporcionando gravações atômicas, leituras consistentes e a possibilidade de consultar a tabela como ela existia em uma versão anterior. A sequência de perguntas é previsível: como funciona a viagem no tempo (leitura de um snapshot anterior do log), o que VACUUM remove e por que isso limita até onde se pode voltar, e como MERGE implementa padrões de upsert e captura de alterações de dados.

  • Aplicação e evolução do esquema. Gravações incompatíveis com o esquema são rejeitadas, a menos que a evolução esteja habilitada; explique quando você a permitiria.
  • OPTIMIZE e disposição dos arquivos. Arquivos pequenos prejudicam o desempenho de leitura; a compactação os regrava, enquanto o clustering ou a ordenação Z reúne valores usados como filtros nas consultas.
  • Streaming e processamento em lote na mesma tabela. A mesma tabela Delta pode ser destino de streaming e origem de processamento em lote; explique exatamente o que significa processamento uma única vez para um job do Structured Streaming que grava no Delta.
  • Delta Live Tables e pipelines. Pipelines declarativos com expectativas de qualidade dos dados; esteja preparado para explicar o que uma expectativa faz quando uma linha não a satisfaz.

Responda explicando o mecanismo. Dizer que o Delta é ACID é o slogan; dizer que o log de transações torna uma gravação parcialmente malsucedida invisível para os leitores é a resposta.

Como são as perguntas sobre arquitetura medallion e design de pipelines?

Você já construiu camadas bronze, silver e gold e suspeita que o entrevistador queira mais do que os nomes. É isso mesmo, por isso esta seção apresenta o raciocínio de design por trás de cada camada e as perguntas que o avaliam.

  • Bronze. Ingestão bruta, somente acréscimos, esquema conforme recebido. Pergunta complementar: por que manter os dados brutos se a camada silver é mais limpa? Para reprocessamento e auditoria.
  • Silver. Registros limpos, desduplicados e padronizados. Pergunta complementar: como desduplicar um fluxo de eventos que podem chegar atrasados ou duas vezes, e onde entram as marcas d'água?
  • Gold. Agregações e tabelas de negócio para analistas e painéis. Pergunta complementar: quem é responsável pelas definições e como evitar que duas tabelas gold apresentem receitas diferentes?
  • Orquestração. Jobs, dependências entre tarefas, novas tentativas e alertas. Pergunta complementar: como tornar um job idempotente para que uma nova execução não faça contagem duplicada?
  • Ingestão. Auto Loader para descoberta incremental de arquivos e por que uma listagem ingênua de diretórios não é escalável.

Os entrevistadores também perguntam sobre custos: por que um cluster de uso geral não é o lugar adequado para um job agendado, quando um cluster de job ou computação sem servidor é apropriado e como o escalonamento automático e as instâncias spot alteram a conta. Apresente a restrição, escolha o mecanismo e indique o custo.

Quais perguntas situacionais e de otimização do Spark devo preparar?

Em processos para cargos seniores, você recebe um sintoma. Um exemplo representativo: um engenheiro de dados em entrevista para uma função de plataforma em uma empresa varejista é informado de que um job noturno, que combina pedidos com uma dimensão de clientes, passou de minutos para horas após um aumento repentino dos dados. Uma resposta sólida começa pelo plano de consulta e pela interface do Spark, não por um cluster maior: verifica se a junção passou a exigir shuffle em vez de broadcast, se há distorção em algumas chaves, se o número de partições de shuffle ainda corresponde ao volume de dados e se as tabelas de origem apresentam problemas de arquivos pequenos que OPTIMIZE corrigiria. O entrevistador avalia a ordem da investigação.

Outros cenários recorrentes: um job de streaming cujo atraso continua aumentando e como os intervalos de disparo, o tamanho do estado e as marcas d'água interagem; um notebook que funciona para um usuário e falha para outro, geralmente uma questão de permissões que leva a Unity Catalog, espaços de trabalho e entidades de serviço; uma tabela que os analistas consideram desatualizada, o que envolve atualidade e orquestração; e uma solicitação para disponibilizar dados com segurança a outra equipe, situação em que entram Delta Sharing e concessões no nível do catálogo.

Pratique esses cenários em voz alta, com perguntas complementares, antes da chamada real; o modo de entrevista simulada foi criado para perguntas situacionais, e o conjunto mais amplo de bancos de perguntas sobre dados e engenharia está em perguntas de entrevista por função e tema.

Um assistente de entrevista com IA pode ajudar com perguntas da Databricks?

Nas etapas de conversa, sim, com limites claros. O aplicativo nativo para desktop do SubcueAI para macOS e Windows captura o áudio do sistema e do seu microfone e exibe sugestões curtas de resposta em uma sobreposição local. Assim, quando o entrevistador pergunta o que uma marca d'água faz na desduplicação de streaming, o mecanismo aparece na tela enquanto você o explica com suas próprias palavras. A extensão para navegador atende chamadas em abas do Chrome e do Edge, capturando apenas o áudio da aba da reunião. Nenhum bot entra na chamada e nada é injetado na página da reunião; as instruções de configuração estão na página do tutorial.

Os limites: uma avaliação supervisionada, uma tela gravada, um laptop gerenciado pela empresa ou um exercício ao vivo em notebook no qual você escreve PySpark sob observação estão fora do escopo — e é aí que as entrevistas da Databricks costumam apresentar sua parte mais difícil. O assistente é mais eficaz para perguntas sobre arquitetura e decisões com vantagens e desvantagens. Primeiro, carregue seu currículo para que as sugestões reflitam os pipelines que você realmente construiu; o criador de currículos armazena esse perfil.

FAQ

O que o Delta Lake acrescenta ao Parquet?

Um log de transações sobre os arquivos Parquet. Esse log oferece confirmações atômicas, leituras consistentes durante gravações, aplicação de esquema, upserts com MERGE e viagem no tempo para versões anteriores da tabela.

O que é a arquitetura medallion?

Um design em camadas: bronze armazena os dados brutos ingeridos, silver contém registros limpos e padronizados, e gold mantém agregações para uso empresarial. Cada camada é um contrato de qualidade, para que os consumidores saibam o que foi e o que não foi feito com os dados.

Como acelerar uma junção lenta do Spark no Databricks?

Leia primeiro o plano de consulta. Verifique se uma tabela pequena pode ser distribuída por broadcast, se há distorção em algumas chaves, se a quantidade de partições de shuffle é adequada aos dados e se arquivos pequenos ou a falta de clustering tornam a leitura lenta. Só então considere um cluster maior.

Para que serve o Unity Catalog?

Governança centralizada entre espaços de trabalho: uma hierarquia de catálogo, esquema e tabela, com controle de acesso, linhagem e auditoria definidos uma única vez, não separadamente para cada cluster ou notebook.

O SubcueAI pode ajudar em um exercício supervisionado de notebook da Databricks?

Não. Avaliações supervisionadas e gravadas estão fora do escopo, e programar sob observação é um trabalho que cabe a você. Ele foi desenvolvido para etapas de conversa, e o modo de entrevista simulada é o lugar para praticá-las.

Perguntas relacionadas

← Mais sobre Perguntas de entrevista por cargo e tema