데이터 사이언티스트 면접 질문, 라운드별 정리
작성자 Aaron Cao · 업데이트

데이터 사이언티스트 면접 라운드는 SQL과 Python, 통계와 확률, 실험 설계와 A/B 테스트, 모델링 또는 지표 케이스, 그리고 행동 면접으로 구성됩니다. 실험 설계 라운드가 결과를 가장 많이 좌우하는 이유는 지원자들이 가장 준비를 소홀히 하는 영역이기 때문입니다.
데이터 사이언티스트 면접은 어떤 라운드로 구성되나요?
아마 SQL과 약간의 머신러닝은 준비했겠지만, 그 밖에 무엇이 나올지 확신이 서지 않을 것입니다. 이 섹션에서는 이런 면접에서 반복적으로 등장하는 다섯 개의 라운드를 정리해, 준비 방향을 평가 기준에 맞출 수 있도록 돕습니다. 각 라운드는 서로 다른 역량을 평가하며, 기술 라운드 두 개만 준비하는 것이 뛰어난 지원자가 오퍼를 놓치는 가장 흔한 이유입니다.
- SQL과 코딩. 쿼리 작성과 Python을 이용한 데이터 처리로, 대개 라이브로 진행됩니다.
- 통계와 확률. 증명이 아니라 해석과 추론을 평가합니다.
- 실험 설계. A/B 테스트: 무엇을 측정할지, 얼마나 오래 진행할지, 언제 결과를 신뢰할지를 다룹니다.
- 모델링 또는 케이스. 직접 틀을 잡고 높은 수준에서 풀어나가는 개방형 문제입니다.
- 행동 면접과 이해관계자 대응. 모호함과 의견 충돌, 아무도 원하지 않았던 결과를 어떻게 다뤘는지를 묻습니다.
직함은 회사마다 다릅니다. 어떤 회사는 데이터 사이언티스트라는 직함으로 애널리스트 라운드를 진행하기도 하고, 그 반대인 경우도 있습니다. 이 페이지의 애널리스트 버전을 보고 싶다면 직무별 면접 질문 허브에 있습니다.
통계와 실험 설계 관련 질문에는 어떤 것이 있나요?
통계와 확률
- p값은 실제로 무엇을 의미하고, 무엇을 의미하지 않나요?
- 신뢰구간을 두 문장으로 프로덕트 매니저에게 설명해 보세요.
- z검정 대신 t검정을 사용하는 것은 어떤 경우인가요?
- 중심극한정리란 무엇이며, 왜 당신의 업무에 중요한가요?
- 지표가 변화했고 결과가 유의미합니다. 그런데도 그것이 틀렸을 수 있는 이유는 무엇인가요?
- 당신의 팀이 실제로 내리는 의사결정을 예로 들어 1종 오류와 2종 오류를 설명해 보세요.
- 선택 편향이란 무엇이며, 데이터에서 어떻게 발견하나요?
- 중앙값이 평균보다 더 나은 요약값이 되는 경우는 언제인가요?
실험 설계와 A/B 테스트
- 새로운 온보딩 플로우를 테스트하는 실험을 어떻게 설계하겠습니까?
- 표본 크기는 어떻게 정하며, 그 크기에 도달할 수 없다면 어떻게 하나요?
- 테스트가 사흘 만에 유의미해졌습니다. 바로 출시하시겠습니까?
- 신기 효과란 무엇이며, 이를 실제 상승효과와 어떻게 구분하나요?
- 여러 지표가 서로 다른 방향으로 움직인다면 어떻게 처리하나요?
- 테스트 도중 무작위 배정이 깨졌다면 어떻게 하겠습니까?
- 시장 전체에 걸친 가격 변경처럼 무작위 배정을 할 수 없는 것은 어떻게 측정하나요?
주목할 만한 패턴이 있습니다. 이 질문들 중 정답이 하나뿐인 경우는 거의 없습니다. 평가 기준은 당신이 가정을 명시했는지, 트레이드오프를 언급했는지, 무엇을 확인할지 말했는지입니다.
모델링, SQL, 프로덕트 관련 질문에는 어떤 것이 있나요?
모델링
- 고객 이탈을 예측하는 모델을 어떻게 만드시겠습니까? 먼저 '이탈'을 어떻게 정의할지부터 시작해 보세요.
- 당신의 모델이 불균형 데이터셋에서 정확도 95%를 기록했습니다. 이것은 좋은 결과인가요?
- 당신이 실제로 출시한 모델을 예로 들어 편향-분산 트레이드오프를 설명해 보세요.
- 이 문제에서 단순한 모델과 복잡한 모델 중 어느 쪽을 선택할지 어떻게 결정하나요?
- 배포 이후 모델이 더 이상 제대로 작동하지 않는다는 것을 어떻게 아나요?
- 정규화를 써본 적 없는 사람에게 정규화를 설명해 보세요.
SQL과 Python
- 각 사용자의 첫 구매일과 최근 구매일을 반환하는 쿼리를 작성하세요.
- 일일 활성 사용자 수의 이레 이동평균을 계산하세요.
- 가입 월별 코호트의 전환율을 구하세요.
pandas에서 롱 테이블을 와이드 테이블로 바꾸는 방법과, 그렇게 하지 않아야 할 때를 설명하세요.- 거래 테이블에서 중복 행을 어떻게 찾아 처리하겠습니까?
프로덕트 센스와 지표
- 새로운 기능이 성공적인지 어떻게 측정하겠습니까?
- 일일 활성 사용자는 늘었는데 매출은 제자리입니다. 원인을 조사해 보세요.
- 경영진 대시보드에 단 하나의 지표를 올린다면 무엇을 올리고, 무엇을 뺄 건가요?
- 좋은 리텐션 곡선과 나쁜 리텐션 곡선을 어떻게 구분하나요?
이 질문들은 어떻게 연습해야 하나요?
질문 목록을 읽으면 낯이 익어질 뿐입니다. 면접에서 시험하는 것은 시간 압박 속에서, 누군가 말을 끊는 상황에서 실제로 답을 만들어내는 능력이며, 이는 전혀 다른 스킬입니다. 이 격차는 실험 설계와 케이스 라운드에서 가장 두드러지는데, 이곳의 답은 사실 나열이 아니라 구조화된 논증이기 때문입니다.
- 소리 내어, 타이머를 켜고 답하세요. 케이스 질문 하나당 육 분, 메모 없이, 다시 시작하지 않고 진행합니다.
- 가정부터 먼저 말하세요. 무엇을 가정하고 있는지 밝히는 것 자체가 평가 대상이며, 동시에 생각할 시간도 벌어줍니다.
- 끊기는 상황을 연습하세요. 실제 면접관은 이 분째에 끼어듭니다. 끊기지 않는 독백을 연습해서는 이런 상황에 대비할 수 없습니다.
- SQL을 직접 손으로 써 보세요. 라이브 라운드에서는 자동완성도, 쿼리를 실행할 방법도 없는 순수 텍스트 에디터를 쓰는 경우가 많습니다.
- 모든 결과를 두 번 설명하세요. 한 번은 기술적으로, 한 번은 당신의 방법론에 관심 없는 이해관계자에게 맞춰서요.
경력 사 년 차의 한 데이터 사이언티스트는 한 마켓플레이스 기업 면접을 준비하며 문서에 정리된 백 개의 질문을 검토했지만, "테스트가 사흘 만에 유의미해졌다면 바로 출시하겠는가"라는 질문에서 얼어붙고 말았습니다. 그 답을 소리 내어 말해본 적이 한 번도 없었기 때문입니다. 내용은 머릿속에 있었지만, 전달하는 연습은 되어 있지 않았던 것입니다. 후속 질문까지 곁들여 이런 질문들을 훈련하고 싶다면, 모의 면접 모드가 해당 라운드를 그대로 진행하며 당신의 답변에 반박합니다.