Perguntas de entrevista de data scientist, por etapa

Por Aaron Cao · Atualizado em

Perguntas de entrevista de data scientist, por etapa
As entrevistas de data scientist cobrem SQL e Python, estatística e probabilidade, design de experimentos e testes A/B, um case de modelagem ou de métricas, e perguntas comportamentais. A etapa de experimentação é a que mais decide o resultado, porque é a que os candidatos menos preparam.

As entrevistas de data scientist cobrem SQL e Python, estatística e probabilidade, design de experimentos e testes A/B, um case de modelagem ou de métricas, e perguntas comportamentais. A etapa de experimentação é a que mais decide o resultado, porque é a que os candidatos menos preparam.

Quais etapas tem uma entrevista de data scientist?

Você provavelmente já preparou SQL e um pouco de machine learning, e não tem certeza do que mais vem pela frente. Esta seção mapeia as cinco etapas que esses processos reutilizam, para que sua preparação combine com a avaliação. Cada etapa testa algo diferente, e preparar apenas as duas técnicas é a forma mais comum de candidatos fortes perderem ofertas.

  • SQL e programação. Escrever queries mais manipulação de dados com Python, geralmente ao vivo.
  • Estatística e probabilidade. Interpretação e raciocínio, não demonstrações.
  • Design de experimentos. Testes A/B: o que medir, por quanto tempo rodar, quando confiar no resultado.
  • Modelagem ou case. Um problema aberto que você estrutura e resolve em alto nível.
  • Comportamental e stakeholders. Como você lidou com ambiguidade, discordância e resultados que ninguém queria.

Os títulos variam. Uma empresa que chama a vaga de data scientist pode, na prática, rodar um processo de analyst, e vice-versa. Se você quer a versão para analyst desta página, ela está no hub de perguntas de entrevista por cargo.

Quais perguntas de estatística e experimentação aparecem?

Estatística e probabilidade

  • O que um valor-p realmente significa, e o que ele não significa?
  • Explique um intervalo de confiança para um product manager em duas frases.
  • Quando você usaria um teste t em vez de um teste z?
  • O que é o teorema do limite central, e por que ele importa para o seu trabalho?
  • Uma métrica se moveu e o resultado é significativo. Por que ele ainda pode estar errado?
  • Explique o erro Tipo I e Tipo II usando uma decisão que sua equipe realmente toma.
  • O que é viés de seleção, e como você o detectaria nos seus dados?
  • Quando a mediana é um resumo melhor do que a média?

Design de experimentos e testes A/B

  • Como você desenharia um experimento para testar um novo fluxo de onboarding?
  • Como você escolhe o tamanho da amostra, e o que acontece se não conseguir alcançá-lo?
  • Seu teste fica significativo depois de três dias. Você lança?
  • O que é um efeito novidade, e como você o separaria de um ganho real?
  • Como você lida com várias métricas se movendo em direções diferentes?
  • O que você faria se a randomização quebrasse no meio do teste?
  • Como você mediria algo que não pode randomizar, como uma mudança de preço em todo um mercado?

O padrão a notar: quase nenhuma dessas perguntas tem uma única resposta correta. A avaliação considera se você nomeia a suposição, expõe o trade-off e diz o que verificaria.

Quais perguntas de modelagem, SQL e produto aparecem?

Modelagem

  • Como você construiria um modelo para prever o churn de clientes? Comece por como você definiria churn.
  • Seu modelo tem 95 por cento de accuracy em um dataset desbalanceado. Isso é bom?
  • Explique o trade-off entre viés e variância usando um modelo que você colocou em produção.
  • Como você decidiria entre um modelo simples e um complexo para este problema?
  • Como você sabe que um modelo parou de funcionar depois do deployment?
  • Explique regularização para alguém que nunca a usou.

SQL e Python

  • Escreva uma query que retorne a primeira e a mais recente data de compra de cada usuário.
  • Calcule uma média móvel de sete dias dos usuários ativos diários.
  • Encontre a taxa de conversão por mês de coorte.
  • Em pandas, transforme uma tabela longa em larga e explique quando você não faria isso.
  • Como você encontraria e trataria linhas duplicadas em uma tabela de transações?

Product sense e métricas

  • Como você mediria se uma nova feature é bem-sucedida?
  • Os usuários ativos diários subiram, mas a receita está estagnada. Investigue.
  • Qual métrica única você colocaria no dashboard da liderança, e qual deixaria de fora?
  • Como você distinguiria uma boa curva de retenção de uma ruim?

Como você deve praticar isso?

Ler uma lista de perguntas gera reconhecimento. As entrevistas testam desempenho sob pressão de tempo com alguém te interrompendo, e essas são habilidades diferentes. A lacuna aparece mais nas etapas de experimento e case, onde a resposta é um argumento estruturado, não um fato solto.

  • Responda em voz alta, com cronômetro. Seis minutos por pergunta de case, sem anotações, sem recomeçar.
  • Diga suas suposições primeiro. Nomear o que você está assumindo é avaliado, e também compra tempo para pensar.
  • Pratique ser interrompido. Entrevistadores de verdade interrompem no minuto dois. Ensaiar um monólogo sem interrupções não te prepara para isso.
  • Escreva SQL à mão. Etapas ao vivo geralmente usam um editor simples, sem autocompletar e sem forma de rodar a query.
  • Explique cada resultado duas vezes. Uma vez tecnicamente, outra para um stakeholder que não liga para o seu método.

Uma data scientist com quatro anos de experiência se preparou para um processo de marketplace revisando cem perguntas em um documento, e então travou em "seu teste fica significativo depois de três dias, você lança?" porque nunca tinha dito uma resposta em voz alta. O conteúdo estava na cabeça dela; a entrega não. Se você quer treinar isso com perguntas de acompanhamento, o modo entrevista simulada conduz a etapa e questiona suas respostas.

FAQ

Quanto SQL eu preciso saber para uma entrevista de data scientist?

O suficiente para escrever joins, funções de janela e agregações com fluência e sem documentação. SQL é mais um filtro do que um diferencial: passar nele é esperado, e nenhum polimento extra de SQL compensa uma etapa de experimentação fraca.

Qual é a diferença entre as perguntas de data scientist e de data analyst?

Os processos de analyst giram em torno de SQL e cases de negócio. Os de data scientist somam design de experimentos e modelagem, e levam a estatística da interpretação para decisões de design. As etapas comportamental e de stakeholders são quase idênticas.

Preciso de profundidade em machine learning para toda vaga de data scientist?

Não. Vagas de product data scientist costumam pesar muito mais experimentação e métricas do que modelagem, enquanto vagas de research ou platform invertem isso. Pergunte ao recrutador quais etapas estão agendadas antes de decidir o que estudar.

Qual é o motivo mais comum de os candidatos falharem nesses processos?

Responder às perguntas de experimento e case como fatos, em vez de argumentos. Os entrevistadores avaliam se você nomeou a suposição, escolheu uma métrica de forma deliberada e disse o que verificaria, não se você chegou à conclusão preferida deles.

Como eu pratico essas perguntas sem um parceiro?

Responda em voz alta com cronômetro e se grave, depois revise se você declarou suposições e estrutura. Um entrevistador simulado com IA também pode conduzir a etapa e interromper com perguntas de acompanhamento, o que se aproxima mais da pressão real do que ler uma lista.

Perguntas relacionadas

← Mais sobre Perguntas de entrevista por cargo e tema