AI 면접 어시스턴트는 억양을 잘 인식할까요?

작성자 Aaron Cao · 업데이트

AI 면접 어시스턴트는 억양을 잘 인식할까요?
대체로 그렇지만, 인식 엔진의 학습 데이터에 잘 반영되지 않은 억양에서는 정확도가 떨어집니다. 가장 중요한 것은 면접관의 억양입니다. 제안을 촉발하는 것이 바로 면접관의 발화이기 때문입니다. 억양별 설정은 존재하지 않으며, 지역별 영어 변이는 모두 하나의 음향 모델로 통합됩니다.

대체로 그렇지만, 인식 엔진의 학습 데이터에 잘 반영되지 않은 억양에서는 정확도가 떨어집니다. 가장 중요한 것은 면접관의 억양입니다. 제안을 촉발하는 것이 바로 면접관의 발화이기 때문입니다. 억양별 설정은 존재하지 않으며, 지역별 영어 변이는 모두 하나의 음향 모델로 통합됩니다.

누구의 억양을 말하는 걸까요?

이 질문은 사실 두 갈래로 나뉘며, 각각 답이 다릅니다. 당신 자신의 억양은 당신의 발화가 어떻게 텍스트로 변환되는지에 영향을 줍니다. 반면 면접관의 억양은 어시스턴트가 답변하려는 질문을 제대로 이해했는지에 영향을 주며, 바로 이 부분이 화면에 표시되는 제안이 쓸모 있는지 없는지를 결정합니다.

macOS와 Windows 데스크톱 앱에서는 양쪽 소리가 모두 캡처됩니다. 시스템 오디오는 면접관의 소리를, 마이크는 당신의 소리를 각각 담당하며, 두 스트림은 별도로 인식됩니다. 새로운 제안을 촉발하는 것은 면접관이 말을 마친 완전한 문장뿐입니다. 브라우저 확장 프로그램의 사이드 패널은 범위를 더 좁혀 회의 탭의 오디오만 캡처하므로, 면접관의 소리만 듣고 당신의 발화는 절대 텍스트로 변환하지 않습니다. 만약 걱정되던 것이 바로 당신 자신의 억양이었다면, 이 확장 프로그램은 그 문제 자체를 완전히 없애줍니다.

인식 엔진이 조정하는 것과 조정하지 않는 것

언어를 선택하면 억양도 함께 선택되는 것이라고, 아직 찾아보지 못한 어딘가에 인도식 영어나 스코틀랜드식 영어 옵션이 있을 것이라고 생각하는 것은 합리적으로 보입니다. 하지만 그렇지 않습니다. 언어 설정은 언어만 선택할 뿐, 그 이상으로 세분화되지 않습니다. 지역별 변이는 오디오가 인식 엔진에 도달하기 전에 이미 통합되므로, 영국식 영어와 미국식 영어는 동일한 요청으로 도착합니다.

자동으로 일어나는 일은 다음과 같습니다. 기본값인 자동 감지 모드에서는, 당신이 언어를 직접 선언할 필요 없이 엔진이 발화 시작 몇 초 안에 언어를 파악합니다. 억양이 있는 발화의 정확도는 그 억양이 인식 모델의 학습 데이터에 얼마나 반영되어 있는지에 따라 결정되며, 이는 어떤 설정에도 노출되지 않고 앱에서도 재정의할 수 없습니다. 조절 다이얼이 존재하는 것처럼 암시하기보다는 이렇게 솔직히 말하는 편이 낫습니다. 언어 필드의 위치는 튜토리얼 페이지에 나와 있습니다.

텍스트 변환 오류는 화면에 어떻게 나타날까요

오류는 극적으로 나타나는 경우가 거의 없습니다. 잘못 들은 전문 용어 하나, 빠뜨린 부정어 하나가 유창하고 자신감 넘치지만 면접관이 묻지도 않은 것에 답하는 제안으로 바뀝니다. 이 실패는 조용히 일어나기 때문에, 바로 그래서 알아둘 가치가 있습니다.

바로 이런 이유로 SubcueAI의 창립자 Aaron Cao는 실시간 텍스트 변환을 숨기지 않고 제안 옆 화면에 표시하기로 했습니다. 시스템이 들었다고 판단한 문장을 직접 보면 약 1초 만에 불일치를 알아챌 수 있습니다. 반면 텍스트 변환이 보이지 않는 제안이라면, 가장 실수해서는 안 되는 순간에 블랙박스를 그저 믿을 수밖에 없게 됩니다.

길러둘 만한 습관은, 먼저 텍스트 변환 줄을 읽고 그다음에 제안을 읽는 것입니다. 둘이 다르다면 당신의 귀를 믿으십시오. 캡처와 답변 생성이 어떻게 맞물려 작동하는지는 작동 원리 페이지들에서 다룹니다.

실제로 정확도를 높이는 방법

아래 방법들 중 어느 것도 음향 모델 자체를 바꾸지는 않으며, 강한 억양을 가벼운 억양처럼 변환되게 만들지도 않습니다. 이 방법들이 하는 일은, 당신 스스로 없앨 수 있는 오류를 없애는 것입니다.

  • 스피커 대신 헤드셋 사용: 면접관의 오디오를 깨끗하게 유지하고, 방 안 울림이 다시 텍스트로 변환되는 것을 막습니다.
  • 조용한 공간: 배경 대화 소리는 사람들이 과소평가하는 오류 원인입니다. 인식 엔진은 어떤 목소리가 면접 목소리인지 알지 못하기 때문입니다.
  • 자동 감지 대신 언어를 직접 지정하기: 면접이 독일어로 진행된다는 것을 이미 알고 있다면, 미리 지정해두면 시작 몇 초 동안의 감지 흔들림을 피할 수 있습니다.
  • 동시에 재생되는 오디오 소스 줄이기: 음악, 알림음, 두 번째 통화는 모두 같은 시스템 오디오 스트림에 함께 섞여 들어갑니다.

실제로 사용할 예정인 하드웨어로 모의 면접을 한 번 진행해보는 것이, 문제가 되기 전에 실제 오류율을 확인하는 가장 빠른 방법입니다.

자주 묻는 질문

억양이 강해도 이해하나요?

대체로 이해하지만, 억양이 약한 발화보다 오류율이 더 높습니다. 정확도는 인식 모델의 학습 데이터에 따라 결정되며, 앱 내 어떤 설정으로도 이를 바꿀 수 없습니다.

인도식 영어나 호주식 영어 옵션이 있나요?

없습니다. 지역별 변이는 오디오가 인식 엔진에 도달하기 전에 기본 언어로 통합되므로, 영국식 영어와 미국식 영어는 동일한 음향 모델에서 작동합니다.

제 자신의 억양이 답변 제안에 영향을 미치나요?

데스크톱 앱에서는 당신이 아니라 면접관의 발화가 제안을 촉발합니다. 브라우저 확장 프로그램의 사이드 패널은 당신의 마이크를 전혀 텍스트로 변환하지 않습니다.

텍스트 변환이 틀리면 어떻게 되나요?

제안이 유창하게, 그러나 엉뚱한 질문에 답하게 됩니다. 텍스트 변환 내용이 제안 옆에 표시되므로 이를 알아챌 수 있으며, 그래서 텍스트 변환 줄을 먼저 읽는 0.5초가 그만한 가치가 있는 것입니다.

자동 감지를 사용해야 할까요, 아니면 언어를 직접 선택해야 할까요?

자동 감지는 잘 작동하며 데스크톱의 기본값입니다. 면접에 사용될 언어를 이미 알고 있다면, 이를 명시적으로 지정하면 시작 몇 초 동안의 감지 흔들림을 피할 수 있습니다.

관련 질문

← 더 보기: 작동 방식