Data Scientist 面試題
來自各公司指南的代表性 Data Scientist 面試題,依考察重點分組。它們是備考範例,不是任何公司經確認的題庫。
行為面 (23)
請分享一次你與隊友在分析方法上意見不合的經驗。你們是如何做出決定的?
請分享一次證據促使你改變原先做法的經驗。
你會為新產品功能選擇哪項指標,又會監控哪些失效模式?
請說明一次你透過清楚傳達複雜分析而改變決策的經驗。
請分享一次你發現自己的分析有誤的經驗。接下來你做了什麼?
請分享一次你向非技術合作夥伴解釋技術結果的經驗。
請分享一項曾改變決策的分析,以及你如何向非技術合作夥伴說明它。
請分享一次你的分析改變團隊決策的經驗。
請描述一次你在收到相互矛盾的證據後改變分析方式的經驗。
請分享一次新證據促使你改變分析方法的經驗。
請分享一個你的分析改變了決策的真實情境。
請談談你曾主動負責一項目標不明確之分析的經驗。
請分享一次你與他人對分析結果意見不一致的經驗,以及你如何與協作者共同解決問題。
你為什麼想以資料科學家的身分加入 Boston Consulting Group?
請分享一個你的分析改變了決策的專案。
你能否描述一次在取得新證據後改變分析方法的經驗?
請分享一個模型表現未能轉化為實用商業決策的案例。
請分享一次新證據促使你修改分析建議的經驗。
當故障很少發生、且同一設備的觀測值彼此相關時,你會如何驗證設備故障預測模型?
當你負責的專案中,利害關係人對你的資料判讀存在分歧時,你是如何處理的?
你能否談一次因發現自己分析中的錯誤,而改變原有建議的經驗?
請談一次你的分析挑戰了團隊傾向性結論的經驗。你當時如何處理這種分歧?
你曾如何處理與利害關係人在分析結果上的分歧?
程式 (26)
寫一段 SQL 查詢來比較不同客群的參與度,並說明你會如何驗證結果。
你會如何撰寫 SQL 查詢,在避免重複記錄的同時,比較不同顧客群組的留存率?
撰寫一個 SQL 查詢,在處理缺失活動資料的同時比較不同使用者群組的參與度。
你會如何撰寫 SQL 查詢來找出重複的使用者活動,並確認重複資料不會扭曲結果?
撰寫一段 SQL 查詢,在處理遺漏紀錄的同時比較不同群組的留存率。
假設有一張事件資料表與一張使用者資料表,你會如何撰寫 SQL 來比較不同群組的轉換率?
你會如何撰寫 SQL 查詢,在處理事件缺漏的同時比較不同群組的留存率?
你會如何撰寫 SQL 查詢,找出活動量在連續期間內下降的使用者?
你會如何撰寫 SQL 查詢,在處理延遲抵達事件的同時,比較不同實驗組別的留存率?
撰寫 SQL,找出活動量較前一期增加的會員。
請撰寫 SQL 查詢,在處理缺失值的同時比較不同客戶群體的轉換率。
你會如何撰寫 SQL 查詢,以比較不同客戶群體的留存率?
你會如何撰寫 SQL 查詢,以比較不同客戶群體的留存率?
你會如何撰寫 SQL 查詢,比較不同商家群組的留存率?
你會如何安排程式碼,以清理、驗證及分析不熟悉的資料集?
你會撰寫什麼 SQL 查詢,以識別收聽行為的持續性變化?
請撰寫 SQL 查詢,在避免重複事件的同時,比較不同同期群的互動情況。
請撰寫 SQL 查詢來比較不同群組的留存率,並說明你會如何驗證結果。
撰寫一個 SQL 查詢,找出活動量在連續期間內下降的使用者。
你會如何撰寫查詢,以辨識客戶行為隨時間發生的變化?
你會如何撰寫 SQL 查詢,在檢查缺失資料的同時,比較不同實驗組別的轉換率?
如果有一張事件資料表與一張客戶資料表,你會如何撰寫查詢來比較不同群組的留存率?
你會如何撰寫 SQL 查詢,找出交易活動中的異常變化?
一張事件表中存在重複紀錄與時間戳記。你會如何撰寫SQL,在不重複計算的情況下,找出在首次活躍日之後又回訪的使用者?
你會如何寫出 SQL 查詢,在處理重複時間戳記的同時找出每台設備最新的有效讀數?
如果要依商家統計付款成功率,你會如何運用付款識別碼、嘗試識別碼、時間戳記與結果狀態撰寫 SQL?
系統設計 (24)
你會如何設計一個實驗,來衡量某項產品變更是否提升了使用者留存率?
你會如何設計實驗,以測試推薦內容的變更是否能改善顧客成果?
你會如何設計實驗,以衡量產品變更是否提高使用者留存率?
當隨機分派受到限制時,你會如何設計實驗?
你會如何設計實驗,以衡量一項新產品功能是否能提高使用者留存率?
你會如何設計實驗,判斷產品變更是否改善了使用者成果?
你會如何設計實驗,以衡量產品變更是否能提高乘客留存率?
你會如何設計實驗,測試推薦內容的變更能否提升會員參與度?
你會如何設計實驗,以衡量推薦機制的變更是否提升了有意義的互動?
你會如何設計實驗,以判斷產品變更是否能提高客戶留存率?
你會如何設計實驗,以衡量產品變更是否能提升使用者參與度?
你會如何設計實驗,以判斷產品變更是否帶來改善?
你會如何設計實驗,測試商家結帳行為的變化?
你會如何設計實驗,以測試某項變更對聽眾參與度的影響?
你會如何設計實驗,以測試產品變更能否提升創作者留存率?
你會如何設計實驗,以判斷產品變更是否改善了使用者成果?
你會如何設計實驗,以測試產品變更是否能提升客戶留存率?
無法隨機分派時,你會如何設計實驗?
你會如何設計實驗,以測試產品變更是否能提升客戶留存率?
你會如何設計實驗,衡量新的客戶功能是否改變了互動程度?
你會如何設計實驗,判斷產品變更是否影響了客戶行為?
你會如何設計一個實驗,來檢驗某項製造流程變更是否能提高良率?
當針對房客的改動也可能影響房東時,你會如何設計實驗?
你會如何設計一個測試新用戶導覽流程的實驗?
技術 (121)
某項關鍵產品指標在一次上線後下滑,你會如何調查原因?
在可解釋的模型與預測表現更好但更複雜的模型之間,你會如何選擇?
你會如何向需要據此採取行動的非技術主管說明一個帶有不確定性的模型結果?
如果互動指標與護欄指標呈現相互衝突的變化,你會如何調查?
當資料會隨時間變化時,你會如何選擇並驗證需求預測模型?
你會如何向不使用統計方法的營運主管解釋模型結果?
你會如何判斷產品變更是否造成留存率出現觀察到的提升?
你會如何偵測並處理觀察性分析中的選擇偏誤?
你會如何向產品主管解釋具有統計顯著性、但實際影響很小的結果?
某項關鍵指標在推出後上升。你會如何判斷這項變更是否造成了改善?
你會如何偵測並處理訓練資料集中的選擇偏誤?
當預測效能與可解釋性指向不同方向時,你會如何比較兩種建模方法?
你會如何向非技術背景的利害關係人解釋模型建議及其不確定性?
你會如何判斷指標變化是否具有統計意義,且在實務上有用?
你會如何在可解釋的基準模型與更複雜的模型之間做選擇?
某個模型在線下表現良好,但部署後表現不佳。你會如何調查?
你會如何向非技術受眾解釋違反直覺的結果,並建議下一步行動?
如果某項指標變化只出現在一個使用者區隔中,你會如何調查?
在什麼情況下,你會選擇較簡單的模型,而不是更準確但較難解釋的模型?
你會如何向產品主管說明一項沒有明確結論的實驗?
如果一項實驗的主要指標改善,但護欄指標惡化,你會如何調查?
你會如何在可解釋的基準模型與較複雜的模型之間做出選擇?
面對希望獲得明確建議的非技術決策者,你會如何解釋幅度小且具有不確定性的效果?
請舉例說明新證據曾如何促使你改變分析建議?
在相信隨機實驗的結果之前,你會進行哪些檢查?
你會如何在簡單且可解釋的模型與更複雜的模型之間做選擇?
一項實驗提高了轉換率,卻也增加了取消率。你會如何調查並說明其中的取捨?
哪些偏差可能使實驗結果失效?你會如何偵測這些偏差?
為了預測觀看行為,你會如何在簡單模型與較複雜的模型之間做選擇?
某項指標整體有所改善,卻在一個重要客群中下滑。你會如何調查並說明這項取捨?
某項處置提高了點擊量,卻降低了後續留存率。你會如何解讀這項結果?
你會如何在可解釋模型與準確度較高但不透明的模型之間做出選擇?
你會如何向沒有統計背景的產品合作夥伴解釋信賴區間?
對於高風險預測,你會如何在可解釋模型與較複雜的模型之間做出選擇?
你的模型在線下表現良好,但部署後表現不佳。你會如何調查?
請向不從事統計工作的商業利害關係人解釋信賴區間。
在信任實驗結果之前,你會進行哪些檢查?
你會如何調查關鍵產品指標突然發生變化的原因?
你會如何在簡單的基準模型與更複雜的預測模型之間做出選擇?
你會如何向非技術背景的利害關係人說明沒有明確結論的分析?
在信任實驗結果之前,你會進行哪些檢查?
你會如何在簡單模型與較複雜的模型之間做選擇?
如果模型在驗證時表現良好,但部署後表現不佳,你會如何診斷?
你會如何向非技術利害關係人解釋具有不確定性的結果?
在解讀實驗結果前,你會檢查哪些假設?
針對商業決策,你會如何在簡單模型與較複雜模型之間做選擇?
某項關鍵指標出現非預期變化。你會如何調查原因?
你會如何向非技術合作夥伴說明統計上仍具不確定性的結果?
你會如何在較簡單的模型與較準確但較難解釋的模型之間做選擇?
你會如何向非技術利害關係人說明一項沒有明確結論的實驗?
請描述當新證據改變你的建議時,你如何調整做法。
產品上線後,一項關鍵指標上升,但一項護欄指標下降。你會如何調查,並建議下一步?
你會如何在可解釋模型與準確度較高但透明度較低的模型之間做選擇?
你會如何向產品經理解釋信賴區間及其決策價值?
你會如何在可解釋的基準模型與更複雜的模型之間做選擇?
某項關鍵指標出現意外變化。你會如何診斷原因?
如果不具技術背景的決策者不同意你的建議,你會如何向對方解釋分析結果?
請描述一個開放式資料問題、你考慮過的替代方案,以及選擇最終做法的原因。
你會如何偵測並處理觀察性資料集中的選擇偏誤?
對於稀有事件預測問題,你會選擇哪種模型,又會如何驗證?
你會如何向非技術主管解釋模型在偽陽性方面的取捨?
請描述一個困難的專案、你所作的選擇,以及你從中學到的事。
你會如何在可解釋模型與準確度更高的複雜模型之間做選擇?
在信任模型的效能之前,你會進行哪些檢查?
請向沒有技術背景的利害關係人解釋一項統計結果。
請描述一次對分析方法的意見分歧,以及你如何處理。
在信任正式環境中的預測模型之前,你會進行哪些檢查?
你會如何在較簡單的模型與較準確但可解釋性較低的模型之間做選擇?
客戶希望降低顧客流失率。你會如何建構問題架構,並決定要求哪些資料?
你會如何向非技術利害關係人說明信賴區間及其商業意義?
在訓練預測模型前,你會如何偵測資料洩漏?
針對類別不平衡的分類問題,你會選擇哪項指標?為什麼?
你會如何向沒有統計背景的利害關係人解釋信賴區間?
使用具時間相依性的資料訓練模型前,你會進行哪些檢查?
你會如何在準確度較高的模型與可解釋性較高的模型之間做出選擇?
你會如何向非技術背景的風險管理合作夥伴解釋模型的限制?
一項實驗提升了參與度,卻降低了留存率。你會如何判斷是否應該建議上線這項改動?
你會如何區分某個效果是由產品改動造成的,還是由季節性因素或被衡量使用者群體的變化所導致?
一個模型在驗證階段表現良好,但上線後表現不佳。在決定是否替換它之前,你會調查哪些方面?
你會如何向一位需要做出上線決策的非技術利害關係人解釋一個不確定的結果?
你為什麼對這個資料科學家職位感興趣?哪個專案最能展現你想做的工作?
在為設備警示功能設計實驗時,你會如何選擇隨機化單位與成功指標?
在什麼情況下,你會選擇一個更簡單的基準模型,而不是準確率更高但更難解釋的模型?
如果一項結果在統計上顯著,但影響太小、不足以改變營運決策,你會如何說明這一點?
如果不同商家規模不同,且顧客可能多次嘗試付款,你會如何測試一項結帳流程的變更?
依商家規模分組後,原本看似上升的付款成功率卻消失了,可能是什麼原因造成的?
當標籤資料延遲到達、且誤將合法付款判定為拒絕會產生業務成本時,你會如何評估一個詐欺偵測模型?
面對一位需要做出上線決策的關係人,你會如何向他說明一次結果不明確的實驗?
設備讀數與生產紀錄之間的連接,可能因為什麼原因誇大你的結果?你會如何發現這一點?
你會如何評估一個用來標記罕見製造缺陷的模型?
如果一個模型在驗證階段表現良好,但在之後的生產批次上表現不佳,你會調查哪些方面?
你會如何向需要做決策的利害關係人解釋一個不確定的結果?
在一個訂房媒合平台中,你會如何定義搜尋排序改動的成功標準?
給定使用者、訂房與取消訂房資料表,你會如何在不重複計算的情況下計算每位活躍使用者的已完成訂房數?
如果一項實驗提升了核心指標,卻增加了取消訂房的數量,你會調查哪些方面?
在避免資訊洩漏的前提下,你會如何驗證一個預測取消訂房的模型?
面對一位正在決定是否上線的產品經理,你會如何解釋一項沒有明確結論的實驗?
p值到底代表什麼?它又不代表什麼?
用兩句話向產品經理解釋信賴區間。
什麼情況下該用t檢定而不是z檢定?
中央極限定理是什麼?它為什麼對你的工作重要?
某個指標出現變化且結果顯著,為什麼它仍可能是錯的?
結合你團隊真實會做的一個決策,解釋第一類錯誤和第二類錯誤。
什麼是選擇偏誤?你會如何在資料中發現它?
什麼時候用中位數比用平均數更能說明問題?
你如何決定樣本數?如果達不到樣本數該怎麼辦?
測試跑了三天就顯著了,你會上線嗎?
什麼是新奇效應?你會如何把它和真實的提升區分開來?
如果多個指標朝不同方向變化,你會怎麼處理?
如果隨機分派在測試中途出了問題,你會怎麼辦?
像整個市場範圍的定價調整這種無法隨機分組的變化,你會如何衡量?
你會如何建立一個預測客戶流失的模型?先從你如何定義「流失」說起。
你的模型在一個不平衡資料集上準確率達到95%,這樣算好嗎?
結合你上線過的一個模型,解釋偏差與變異數的權衡。
面對這個問題,你會如何在簡單模型和複雜模型之間做選擇?
模型上線後,你怎麼知道它已經失效?
向一個沒用過正則化的人解釋什麼是正則化。
你會如何在交易表中找出並處理重複的資料列?
你會如何衡量一項新功能是否成功?
你會把哪一個指標放在管理層儀表板上?又會捨棄哪些?
你會如何區分一條好的留存曲線和一條差的留存曲線?