数据科学家面试题,按轮次划分

作者 Aaron Cao · 更新于

数据科学家面试题,按轮次划分
数据科学家面试轮次涵盖SQL与Python、统计与概率、实验设计与A/B测试、建模或指标案例,以及行为面试问题。实验设计往往最终决定结果,因为这是候选人准备最少的一轮。

数据科学家面试轮次涵盖SQL与Python、统计与概率、实验设计与A/B测试、建模或指标案例,以及行为面试问题。实验设计往往最终决定结果,因为这是候选人准备最少的一轮。

数据科学家面试包含哪些轮次?

你可能已经准备好了SQL和一些机器学习知识,但还不确定接下来会考什么。本节梳理了这类面试反复出现的五个轮次,帮助你把复习重点对准评分标准。每一轮考察的重点都不同,只准备两个技术轮是强候选人丢掉offer的最常见原因。

  • SQL与代码。查询编写加上Python数据处理,通常是现场进行。
  • 统计与概率。考察解读与推理能力,而非证明过程。
  • 实验设计。A/B测试:测什么指标、跑多久、什么时候可以信任结果。
  • 建模或案例。一个开放式问题,由你来界定框架,再给出高层次的解法。
  • 行为与利益相关方沟通。你如何处理模糊情况、分歧,以及没人想要的结果。

头衔并不统一。有的公司把这个岗位叫数据科学家,实际考的却是分析师轮次,反之亦然。如果你想看分析师版本的内容,可以前往按岗位分类的面试问题专题页。

统计与实验类问题有哪些?

统计与概率

  • p值到底意味着什么?它又不代表什么?
  • 用两句话向产品经理解释置信区间。
  • 什么情况下该用t检验而不是z检验?
  • 中心极限定理是什么?它为什么对你的工作重要?
  • 某个指标发生变化且结果显著,为什么它仍可能是错的?
  • 结合你团队真实会做的一个决策,解释第一类错误和第二类错误。
  • 什么是选择偏差?你会如何在数据中发现它?
  • 什么时候用中位数比用平均数更能说明问题?

实验设计与A/B测试

  • 你会如何设计一个测试新用户引导流程的实验?
  • 你如何确定样本量?如果达不到样本量该怎么办?
  • 测试跑了三天就显著了,你会上线吗?
  • 什么是新奇效应?你会如何把它和真实的提升区分开?
  • 如果多个指标朝不同方向变化,你会怎么处理?
  • 如果随机化在测试中途出了问题,你会怎么办?
  • 像整个市场范围的定价调整这种无法随机分组的变化,你会如何衡量?

需要注意的规律是:这些问题几乎都没有唯一正确答案,评分标准在于你是否说明了假设、指出了取舍,并说明了你会去核查什么。

建模、SQL与产品类问题有哪些?

建模

  • 你会如何构建一个预测客户流失的模型?先从你如何定义“流失”说起。
  • 你的模型在一个不平衡数据集上准确率达到95%,这算好吗?
  • 结合你上线过的一个模型,解释偏差-方差权衡。
  • 面对这个问题,你会如何在简单模型和复杂模型之间做选择?
  • 模型上线后,你怎么知道它已经失效?
  • 向一个没用过正则化的人解释什么是正则化。

SQL与Python

  • 写一条查询,返回每个用户的首次和最近一次购买日期。
  • 计算日活跃用户数的七天滚动平均值。
  • 按注册月份分组计算转化率。
  • pandas把一张长表转换成宽表,并说明什么情况下你不会这样做。
  • 你会如何在交易表中查找并处理重复行?

产品判断与指标

  • 你会如何衡量一个新功能是否成功?
  • 日活跃用户在上升,但收入持平,请你排查原因。
  • 你会把哪一个指标放在管理层看板上?又会舍弃哪些?
  • 你会如何区分一条好的留存曲线和一条差的留存曲线?

该如何练习这些问题?

阅读问题清单只能带来“眼熟感”。面试考察的是在时间压力下、被人打断时的临场表现,这是完全不同的能力。这种差距在实验设计轮和案例轮体现得最明显,因为这里的答案是一段结构化的论证,而不是一个事实。

  • 大声计时作答。每道案例题限时六分钟,不看笔记,不能重来。
  • 先说出你的假设。说明你的假设本身就是评分点,同时也能为你争取思考时间。
  • 练习应对打断。真实的面试官往往在第二分钟就会插话。只练习一段不被打断的独白,无法让你为此做好准备。
  • 手写SQL。现场轮次常常只提供一个没有自动补全、也无法运行查询的纯文本编辑器。
  • 把每个结果讲两遍。一遍讲技术细节,一遍讲给不关心你方法的利益相关方听。

一位有四年经验的数据科学家为一次电商平台的面试做准备时,通读了一份包含上百道题目的文档,结果在“测试跑了三天就显著了,你会上线吗”这道题上卡住了,因为她从未大声说出过答案。内容都记在她脑子里,但表达能力没有练过。如果你想通过追问来反复打磨这些问题,模拟面试模式会完整运行这一轮,并对你的回答提出追问。

常见问题

数据科学家面试需要掌握多少SQL?

要熟练到不查文档就能写连接、窗口函数和聚合查询。SQL只是一道筛选门槛,而不是决定性因素:通过它是基本要求,SQL打磨得再精也弥补不了实验设计轮的薄弱。

数据科学家和数据分析师的面试问题有什么区别?

分析师面试以SQL和业务案例为核心。数据科学家面试在此基础上增加了实验设计和建模,并把统计题从“解读结果”提升到“设计决策”的层面。行为面试和利益相关方沟通轮次几乎完全相同。

每个数据科学家岗位都需要很深的机器学习功底吗?

不需要。产品向数据科学家岗位往往更看重实验设计与指标能力,而非建模;研究或平台向岗位则正好相反。在决定复习重点之前,先向招聘人员确认你会经历哪些轮次。

候选人在这类面试中失利的最常见原因是什么?

把实验和案例类问题当成事实来回答,而不是当成一段论证。面试官评分看的是你是否说明了假设、是否有意识地选择了指标、是否说明了会去核查什么,而不是你是否得出了他们心中的“标准答案”。

没有搭档时该如何练习这些问题?

计时、大声作答并录音,然后回顾自己是否说明了假设和论证结构。AI模拟面试官也能完整运行这一轮并追问打断,比单纯读题目清单更接近真实的压力感。

相关问题

← 更多关于 按岗位与主题分类的面试问题