資料科學家面試題,依輪次劃分
作者 Aaron Cao · 更新於

資料科學家面試輪次涵蓋SQL與Python、統計與機率、實驗設計與A/B測試、建模或指標案例,以及行為面試問題。實驗設計往往最終決定結果,因為這是應徵者準備最少的一輪。
資料科學家面試包含哪些輪次?
你可能已經準備好SQL和一些機器學習知識,但還不確定接下來會考什麼。本節整理了這類面試反覆出現的五個輪次,幫助你把複習重點對準評分標準。每一輪考察的重點都不同,只準備兩個技術輪是強勢應徵者丟掉offer的最常見原因。
- SQL與程式撰寫。撰寫查詢加上Python資料處理,通常是現場進行。
- 統計與機率。考察解讀與推理能力,而非證明過程。
- 實驗設計。A/B測試:測什麼指標、跑多久、什麼時候可以信任結果。
- 建模或案例。一個開放式問題,由你來界定框架,再給出高層次的解法。
- 行為與利害關係人溝通。你如何處理模糊情況、意見分歧,以及沒人想要的結果。
職稱並不統一。有的公司把這個職位稱為資料科學家,實際考的卻是分析師輪次,反之亦然。如果你想看分析師版本的內容,可以前往依職位分類的面試問題專題頁。
統計與實驗類問題有哪些?
統計與機率
- p值到底代表什麼?它又不代表什麼?
- 用兩句話向產品經理解釋信賴區間。
- 什麼情況下該用t檢定而不是z檢定?
- 中央極限定理是什麼?它為什麼對你的工作重要?
- 某個指標出現變化且結果顯著,為什麼它仍可能是錯的?
- 結合你團隊真實會做的一個決策,解釋第一類錯誤和第二類錯誤。
- 什麼是選擇偏誤?你會如何在資料中發現它?
- 什麼時候用中位數比用平均數更能說明問題?
實驗設計與A/B測試
- 你會如何設計一個測試新用戶導覽流程的實驗?
- 你如何決定樣本數?如果達不到樣本數該怎麼辦?
- 測試跑了三天就顯著了,你會上線嗎?
- 什麼是新奇效應?你會如何把它和真實的提升區分開來?
- 如果多個指標朝不同方向變化,你會怎麼處理?
- 如果隨機分派在測試中途出了問題,你會怎麼辦?
- 像整個市場範圍的定價調整這種無法隨機分組的變化,你會如何衡量?
需要注意的規律是:這些問題幾乎都沒有唯一正確答案,評分標準在於你是否說明了假設、指出了取捨,並說明了你會去查核什麼。
建模、SQL與產品類問題有哪些?
建模
- 你會如何建立一個預測客戶流失的模型?先從你如何定義「流失」說起。
- 你的模型在一個不平衡資料集上準確率達到95%,這樣算好嗎?
- 結合你上線過的一個模型,解釋偏差與變異數的權衡。
- 面對這個問題,你會如何在簡單模型和複雜模型之間做選擇?
- 模型上線後,你怎麼知道它已經失效?
- 向一個沒用過正則化的人解釋什麼是正則化。
SQL與Python
- 寫一條查詢,回傳每個用戶的首次與最近一次購買日期。
- 計算每日活躍用戶數的七天滾動平均值。
- 按註冊月份分組計算轉換率。
- 用
pandas把一張長表轉換成寬表,並說明什麼情況下你不會這麼做。 - 你會如何在交易表中找出並處理重複的資料列?
產品判斷與指標
- 你會如何衡量一項新功能是否成功?
- 每日活躍用戶在上升,但營收持平,請你排查原因。
- 你會把哪一個指標放在管理層儀表板上?又會捨棄哪些?
- 你會如何區分一條好的留存曲線和一條差的留存曲線?
該如何練習這些問題?
閱讀問題清單只能帶來「眼熟感」。面試考察的是在時間壓力下、被人打斷時的臨場表現,這是完全不同的能力。這種落差在實驗設計輪和案例輪體現得最明顯,因為這裡的答案是一段結構化的論證,而不是一個事實。
- 大聲計時作答。每道案例題限時六分鐘,不看筆記,不能重來。
- 先說出你的假設。說明你的假設本身就是評分要點,同時也能為你爭取思考時間。
- 練習應對打斷。真實的面試官往往在第二分鐘就會插話。只練習一段不被打斷的獨白,無法讓你為此做好準備。
- 手寫SQL。現場輪次常常只提供一個沒有自動補全、也無法執行查詢的純文字編輯器。
- 把每個結果講兩遍。一遍講技術細節,一遍講給不在乎你方法的利害關係人聽。
一位有四年經驗的資料科學家為一次電商平台的面試做準備時,通讀了一份包含上百道題目的文件,結果在「測試跑了三天就顯著了,你會上線嗎」這道題上卡住了,因為她從未大聲說出過答案。內容都記在她腦子裡,但表達能力沒有練過。如果你想透過追問來反覆打磨這些問題,模擬面試模式會完整執行這一輪,並對你的回答提出追問。
常見問題
資料科學家面試需要掌握多少SQL?
要熟練到不查文件就能寫join、視窗函數和聚合查詢。SQL只是一道篩選門檻,而不是決定性因素:通過它是基本要求,SQL打磨得再精也彌補不了實驗設計輪的薄弱。
資料科學家和資料分析師的面試問題有什麼區別?
分析師面試以SQL和商業案例為核心。資料科學家面試在此基礎上增加了實驗設計和建模,並把統計題從「解讀結果」提升到「設計決策」的層次。行為面試和利害關係人溝通輪次幾乎完全相同。
每個資料科學家職位都需要很深的機器學習功力嗎?
不需要。產品導向的資料科學家職位往往更看重實驗設計與指標能力,而非建模;研究或平台導向的職位則恰好相反。在決定複習重點之前,先向招募人員確認你會經歷哪些輪次。
應徵者在這類面試中失利的最常見原因是什麼?
把實驗和案例類問題當成事實來回答,而不是當成一段論證。面試官評分看的是你是否說明了假設、是否有意識地選擇了指標、是否說明了會去查核什麼,而不是你是否得出了他們心中的「標準答案」。
沒有搭檔時該如何練習這些問題?
計時、大聲作答並錄音,然後回顧自己是否說明了假設和論證結構。AI模擬面試官也能完整執行這一輪並追問打斷,比單純讀題目清單更接近真實的壓力感。