คำถามสัมภาษณ์งาน Data Scientist ตามรอบ
โดย Aaron Cao · อัปเดตเมื่อ

การสัมภาษณ์ Data Scientist ครอบคลุม SQL และ Python สถิติและความน่าจะเป็น การออกแบบการทดลองและ A/B testing เคสด้านโมเดลหรือตัวชี้วัด และคำถามด้านพฤติกรรม รอบการทดลองมักเป็นตัวตัดสินผลลัพธ์มากที่สุด เพราะเป็นรอบที่ผู้สมัครเตรียมตัวน้อยที่สุด
การสัมภาษณ์ Data Scientist มีรอบอะไรบ้าง
คุณอาจเตรียม SQL และ machine learning มาบ้างแล้ว แต่ยังไม่แน่ใจว่าจะเจออะไรอีก ส่วนนี้จะแจกแจงห้ารอบที่การสัมภาษณ์แบบนี้ใช้ซ้ำ ๆ เพื่อให้การเตรียมตัวของคุณตรงกับเกณฑ์การให้คะแนน แต่ละรอบวัดสิ่งที่ต่างกัน และการเตรียมแค่สองรอบเชิงเทคนิคคือสาเหตุที่พบบ่อยที่สุดที่ทำให้ผู้สมัครที่แข็งแกร่งพลาดออฟเฟอร์
- SQL และ coding เขียนคิวรีบวกกับจัดการข้อมูลด้วย Python มักเป็นแบบสด
- สถิติและความน่าจะเป็น การตีความและการให้เหตุผล ไม่ใช่การพิสูจน์
- การออกแบบการทดลอง A/B test ว่าจะวัดอะไร รันนานแค่ไหน และเมื่อไรควรเชื่อผลลัพธ์
- โมเดลหรือเคส โจทย์เปิดที่คุณต้องตั้งกรอบเองแล้วแก้ในระดับภาพรวม
- พฤติกรรมและ stakeholder คุณรับมือความคลุมเครือ ความเห็นไม่ตรงกัน และผลลัพธ์ที่ไม่มีใครอยากได้อย่างไร
ชื่อตำแหน่งแตกต่างกันไป บริษัทที่เรียกตำแหน่งนี้ว่า Data Scientist อาจสัมภาษณ์แบบ Analyst จริง ๆ ก็ได้ และในทางกลับกัน ถ้าคุณต้องการเวอร์ชัน Analyst ของหน้านี้ ก็อยู่ใน hub คำถามสัมภาษณ์ตามตำแหน่ง
คำถามด้านสถิติและการทดลองมีอะไรบ้าง
สถิติและความน่าจะเป็น
- p-value หมายความว่าอะไรกันแน่ และไม่ได้หมายความว่าอะไร
- อธิบาย confidence interval ให้ product manager ฟังในสองประโยค
- คุณจะใช้ t-test แทน z-test เมื่อไร
- central limit theorem คืออะไร และทำไมมันสำคัญต่องานของคุณ
- ตัวชี้วัดเปลี่ยนไปและผลลัพธ์มีนัยสำคัญทางสถิติ แต่ทำไมมันยังอาจผิดได้
- อธิบาย Type I และ Type II error โดยใช้การตัดสินใจจริงของทีมคุณ
- selection bias คืออะไร และคุณจะตรวจจับมันในข้อมูลของคุณได้อย่างไร
- median เป็นตัวสรุปที่ดีกว่า mean เมื่อไร
การออกแบบการทดลองและ A/B testing
- คุณจะออกแบบการทดลองอย่างไรเพื่อทดสอบ onboarding flow ใหม่
- คุณเลือกขนาดตัวอย่างอย่างไร และจะเกิดอะไรขึ้นถ้าไปไม่ถึงขนาดนั้น
- การทดสอบของคุณมีนัยสำคัญหลังจากสามวัน คุณจะปล่อยใช้งานเลยไหม
- novelty effect คืออะไร และคุณจะแยกมันออกจาก lift ที่แท้จริงได้อย่างไร
- คุณจัดการอย่างไรเมื่อตัวชี้วัดหลายตัวเคลื่อนไหวคนละทิศทาง
- คุณจะทำอย่างไรถ้า randomisation เสียกลางคันระหว่างการทดสอบ
- คุณจะวัดสิ่งที่ randomise ไม่ได้อย่างไร เช่นการเปลี่ยนราคาทั้งตลาด
รูปแบบที่ควรสังเกตคือ แทบไม่มีคำถามข้อไหนที่มีคำตอบที่ถูกต้องเพียงหนึ่งเดียว การให้คะแนนขึ้นอยู่กับว่าคุณระบุสมมติฐาน อธิบาย tradeoff และบอกว่าคุณจะตรวจสอบอะไรหรือไม่
คำถามด้านโมเดล SQL และผลิตภัณฑ์มีอะไรบ้าง
โมเดล
- คุณจะสร้างโมเดลอย่างไรเพื่อทำนาย customer churn เริ่มจากวิธีที่คุณนิยาม churn
- โมเดลของคุณมี accuracy 95 เปอร์เซ็นต์บน imbalanced dataset ถือว่าดีไหม
- อธิบาย bias-variance tradeoff โดยใช้โมเดลที่คุณเคยปล่อยใช้งานจริง
- คุณจะตัดสินใจอย่างไรระหว่างโมเดลง่าย ๆ กับโมเดลซับซ้อนสำหรับปัญหานี้
- คุณรู้ได้อย่างไรว่าโมเดลหยุดทำงานหลัง deployment
- อธิบาย regularisation ให้คนที่ไม่เคยใช้มันฟัง
SQL และ Python
- เขียนคิวรีที่คืนค่าวันที่ซื้อครั้งแรกและครั้งล่าสุดของผู้ใช้แต่ละคน
- คำนวณ rolling average เจ็ดวันของ daily active users
- หา conversion rate แยกตามเดือนของ cohort
- ใน
pandasให้ reshape ตารางแบบยาวให้เป็นแบบกว้าง แล้วอธิบายว่าเมื่อไรคุณจะไม่ทำแบบนี้ - คุณจะหาและจัดการแถวที่ซ้ำกันในตาราง transaction ได้อย่างไร
Product Sense และตัวชี้วัด
- คุณจะวัดอย่างไรว่าฟีเจอร์ใหม่ประสบความสำเร็จหรือไม่
- daily active users เพิ่มขึ้นแต่รายได้ทรงตัว ให้ตรวจสอบสาเหตุ
- คุณจะเลือกตัวชี้วัดใดตัวเดียวใส่ dashboard ของผู้บริหาร และจะตัดตัวไหนออก
- คุณจะแยก retention curve ที่ดีออกจากที่แย่ได้อย่างไร
คุณควรฝึกซ้อมคำถามเหล่านี้อย่างไร
การอ่านลิสต์คำถามทำให้คุ้นเคยเท่านั้น การสัมภาษณ์จริงจะทดสอบการแสดงผลภายใต้แรงกดดันด้านเวลา พร้อมมีคนคอยขัดจังหวะคุณ ซึ่งเป็นทักษะคนละแบบกัน ช่องว่างนี้เห็นชัดที่สุดในรอบ experiment และ case ที่คำตอบต้องเป็นข้อโต้แย้งที่มีโครงสร้าง ไม่ใช่แค่ข้อเท็จจริง
- ตอบออกเสียงดัง ๆ พร้อมจับเวลา หกนาทีต่อหนึ่งคำถามเคส ห้ามจดโน้ต ห้ามเริ่มใหม่
- บอกสมมติฐานของคุณก่อน การระบุสิ่งที่คุณสมมติเป็นส่วนหนึ่งของคะแนน และยังช่วยซื้อเวลาคิด
- ฝึกให้ถูกขัดจังหวะ ผู้สัมภาษณ์จริงมักขัดจังหวะตั้งแต่นาทีที่สอง การซ้อมพูดคนเดียวแบบไม่มีสะดุดไม่ได้เตรียมคุณให้พร้อมสำหรับสิ่งนั้น
- เขียน SQL ด้วยมือ รอบสดมักใช้ editor ธรรมดาที่ไม่มี autocomplete และไม่มีทางรันคิวรีได้
- อธิบายทุกผลลัพธ์สองครั้ง ครั้งหนึ่งแบบเชิงเทคนิค อีกครั้งให้ stakeholder ที่ไม่สนใจวิธีการของคุณ
data scientist ที่มีประสบการณ์สี่ปีคนหนึ่งเตรียมตัวสำหรับการสัมภาษณ์ marketplace ด้วยการทบทวนคำถามร้อยข้อในเอกสาร แล้วก็ค้างที่คำถาม "การทดสอบของคุณมีนัยสำคัญหลังจากสามวัน คุณจะปล่อยใช้งานเลยไหม" เพราะเธอไม่เคยพูดคำตอบออกมาดัง ๆ เลยสักครั้ง เนื้อหาอยู่ในหัวเธอ แต่การนำเสนอไม่ได้อยู่ด้วย ถ้าคุณอยากฝึกแบบมี follow-up โหมด mock interview จะรันรอบนี้และซักถามคำตอบของคุณ