資料科學家面試題,依輪次劃分

作者 Aaron Cao · 更新於

資料科學家面試題,依輪次劃分
資料科學家面試輪次涵蓋SQL與Python、統計與機率、實驗設計與A/B測試、建模或指標案例,以及行為面試問題。實驗設計往往最終決定結果,因為這是應徵者準備最少的一輪。

資料科學家面試輪次涵蓋SQL與Python、統計與機率、實驗設計與A/B測試、建模或指標案例,以及行為面試問題。實驗設計往往最終決定結果,因為這是應徵者準備最少的一輪。

資料科學家面試包含哪些輪次?

你可能已經準備好SQL和一些機器學習知識,但還不確定接下來會考什麼。本節整理了這類面試反覆出現的五個輪次,幫助你把複習重點對準評分標準。每一輪考察的重點都不同,只準備兩個技術輪是強勢應徵者丟掉offer的最常見原因。

  • SQL與程式撰寫。撰寫查詢加上Python資料處理,通常是現場進行。
  • 統計與機率。考察解讀與推理能力,而非證明過程。
  • 實驗設計。A/B測試:測什麼指標、跑多久、什麼時候可以信任結果。
  • 建模或案例。一個開放式問題,由你來界定框架,再給出高層次的解法。
  • 行為與利害關係人溝通。你如何處理模糊情況、意見分歧,以及沒人想要的結果。

職稱並不統一。有的公司把這個職位稱為資料科學家,實際考的卻是分析師輪次,反之亦然。如果你想看分析師版本的內容,可以前往依職位分類的面試問題專題頁。

統計與實驗類問題有哪些?

統計與機率

  • p值到底代表什麼?它又不代表什麼?
  • 用兩句話向產品經理解釋信賴區間。
  • 什麼情況下該用t檢定而不是z檢定?
  • 中央極限定理是什麼?它為什麼對你的工作重要?
  • 某個指標出現變化且結果顯著,為什麼它仍可能是錯的?
  • 結合你團隊真實會做的一個決策,解釋第一類錯誤和第二類錯誤。
  • 什麼是選擇偏誤?你會如何在資料中發現它?
  • 什麼時候用中位數比用平均數更能說明問題?

實驗設計與A/B測試

  • 你會如何設計一個測試新用戶導覽流程的實驗?
  • 你如何決定樣本數?如果達不到樣本數該怎麼辦?
  • 測試跑了三天就顯著了,你會上線嗎?
  • 什麼是新奇效應?你會如何把它和真實的提升區分開來?
  • 如果多個指標朝不同方向變化,你會怎麼處理?
  • 如果隨機分派在測試中途出了問題,你會怎麼辦?
  • 像整個市場範圍的定價調整這種無法隨機分組的變化,你會如何衡量?

需要注意的規律是:這些問題幾乎都沒有唯一正確答案,評分標準在於你是否說明了假設、指出了取捨,並說明了你會去查核什麼。

建模、SQL與產品類問題有哪些?

建模

  • 你會如何建立一個預測客戶流失的模型?先從你如何定義「流失」說起。
  • 你的模型在一個不平衡資料集上準確率達到95%,這樣算好嗎?
  • 結合你上線過的一個模型,解釋偏差與變異數的權衡。
  • 面對這個問題,你會如何在簡單模型和複雜模型之間做選擇?
  • 模型上線後,你怎麼知道它已經失效?
  • 向一個沒用過正則化的人解釋什麼是正則化。

SQL與Python

  • 寫一條查詢,回傳每個用戶的首次與最近一次購買日期。
  • 計算每日活躍用戶數的七天滾動平均值。
  • 按註冊月份分組計算轉換率。
  • pandas把一張長表轉換成寬表,並說明什麼情況下你不會這麼做。
  • 你會如何在交易表中找出並處理重複的資料列?

產品判斷與指標

  • 你會如何衡量一項新功能是否成功?
  • 每日活躍用戶在上升,但營收持平,請你排查原因。
  • 你會把哪一個指標放在管理層儀表板上?又會捨棄哪些?
  • 你會如何區分一條好的留存曲線和一條差的留存曲線?

該如何練習這些問題?

閱讀問題清單只能帶來「眼熟感」。面試考察的是在時間壓力下、被人打斷時的臨場表現,這是完全不同的能力。這種落差在實驗設計輪和案例輪體現得最明顯,因為這裡的答案是一段結構化的論證,而不是一個事實。

  • 大聲計時作答。每道案例題限時六分鐘,不看筆記,不能重來。
  • 先說出你的假設。說明你的假設本身就是評分要點,同時也能為你爭取思考時間。
  • 練習應對打斷。真實的面試官往往在第二分鐘就會插話。只練習一段不被打斷的獨白,無法讓你為此做好準備。
  • 手寫SQL。現場輪次常常只提供一個沒有自動補全、也無法執行查詢的純文字編輯器。
  • 把每個結果講兩遍。一遍講技術細節,一遍講給不在乎你方法的利害關係人聽。

一位有四年經驗的資料科學家為一次電商平台的面試做準備時,通讀了一份包含上百道題目的文件,結果在「測試跑了三天就顯著了,你會上線嗎」這道題上卡住了,因為她從未大聲說出過答案。內容都記在她腦子裡,但表達能力沒有練過。如果你想透過追問來反覆打磨這些問題,模擬面試模式會完整執行這一輪,並對你的回答提出追問。

常見問題

資料科學家面試需要掌握多少SQL?

要熟練到不查文件就能寫join、視窗函數和聚合查詢。SQL只是一道篩選門檻,而不是決定性因素:通過它是基本要求,SQL打磨得再精也彌補不了實驗設計輪的薄弱。

資料科學家和資料分析師的面試問題有什麼區別?

分析師面試以SQL和商業案例為核心。資料科學家面試在此基礎上增加了實驗設計和建模,並把統計題從「解讀結果」提升到「設計決策」的層次。行為面試和利害關係人溝通輪次幾乎完全相同。

每個資料科學家職位都需要很深的機器學習功力嗎?

不需要。產品導向的資料科學家職位往往更看重實驗設計與指標能力,而非建模;研究或平台導向的職位則恰好相反。在決定複習重點之前,先向招募人員確認你會經歷哪些輪次。

應徵者在這類面試中失利的最常見原因是什麼?

把實驗和案例類問題當成事實來回答,而不是當成一段論證。面試官評分看的是你是否說明了假設、是否有意識地選擇了指標、是否說明了會去查核什麼,而不是你是否得出了他們心中的「標準答案」。

沒有搭檔時該如何練習這些問題?

計時、大聲作答並錄音,然後回顧自己是否說明了假設和論證結構。AI模擬面試官也能完整執行這一輪並追問打斷,比單純讀題目清單更接近真實的壓力感。

相關問題

← 更多關於 依職位與主題分類的面試問題