AI面接アシスタントは訛りに対応できるか?
文責 Aaron Cao · 更新

多くの場合は対応できますが、認識エンジンの学習データに乏しい訛りでは精度が下がります。最も重要なのは面接官の訛りです。提案をトリガーするのは面接官の発話だからです。訛り別の設定は存在せず、地域ごとの英語のバリエーションはすべて単一の音響モデルに集約されます。
誰の訛りについて話しているのか?
この問いは実は二つに分かれており、それぞれ答えが異なります。あなた自身の訛りは、あなたの発話がどう文字起こしされるかに影響します。一方、面接官の訛りは、アシスタントがこれから回答しようとしている質問を正しく理解できたかどうかに影響し、こちらの半分こそが、画面上の提案に価値があるかどうかを左右します。
macOSおよびWindowsのデスクトップアプリでは、両方の音声がキャプチャされます。システム音声が面接官の発話を、マイクがあなたの発話をそれぞれ捉え、二つのストリームは別々に認識されます。新しい提案をトリガーするのは、面接官が話し終えた完全な文だけです。ブラウザ拡張機能のサイドパネルはさらに範囲を絞り込み、会議タブの音声のみをキャプチャするため、面接官の声しか聞き取らず、あなたの発話は決して文字起こしされません。もしあなた自身の訛りが不安の種だったとしても、この拡張機能を使えばその心配は完全になくなります。
認識エンジンが調整するもの、しないもの
言語を選択すれば訛りも選択されるはず、どこかにまだ見つけていないインド英語やスコットランド英語のオプションがあるはず、と考えるのは自然なことです。しかし実際には存在しません。言語設定が選ぶのは言語だけで、それ以上細かい選択肢はありません。地域ごとのバリエーションは音声が認識エンジンに届く前に集約されるため、イギリス英語もアメリカ英語も同じリクエストとして届きます。
自動的に行われているのは次のことです。デフォルトの自動検出では、あなたに言語を宣言させる代わりに、エンジンが発話の最初の数秒から言語を判定します。訛りのある発話の精度は、その訛りが認識モデルの学習データにどれだけ含まれていたかによって決まりますが、これはどの設定にも表示されず、アプリ側で上書きすることもできません。調整用のつまみが存在するかのように示唆するより、率直にそう伝える方が適切です。言語フィールドの場所はチュートリアルページに示されています。
文字起こしのエラーは画面上にどう現れるか
エラーが劇的な形で現れることはほとんどありません。聞き間違えた専門用語や聞き逃した否定語一つで、流暢で自信たっぷりでありながら、面接官が尋ねてもいないことに答える提案が生まれます。この失敗は静かに起こるからこそ、知っておく価値があります。
だからこそ、SubcueAI創業者のAaron Caoは、ライブ文字起こしを隠すのではなく、提案の横に画面表示することにしました。システムが聞き取ったと考えている文を目にすることで、約一秒でズレに気づくことができます。文字起こしが見えない提案では、最も油断できないタイミングでブラックボックスを信頼するしかなくなってしまいます。
身につける価値のある習慣は、まず文字起こしの行を読み、次に提案を読むことです。両者が食い違うときは、自分の耳を信じてください。キャプチャと回答生成がどう連携しているかは、仕組みのページ群で解説されています。
実際に精度を高める方法
以下の対策はどれも音響モデル自体を変えるものではなく、強い訛りを軽い訛りのように文字起こしできるようにするものでもありません。これらが取り除くのは、あなた自身で取り除ける類のエラーです。
- スピーカーではなくヘッドセットを使う:面接官の音声をクリーンに保ち、部屋の反響が再び文字起こしされるのを防ぎます。
- 静かな部屋にする:背景の話し声は人々が見くびりがちなエラー要因です。認識エンジンはどの声が面接の声なのか分からないためです。
- 自動検出ではなく言語を指定する:面接がドイツ語で行われるとあらかじめ分かっている場合、そう指定しておけば冒頭数秒の検出のふらつきを避けられます。
- 並行する音声ソースを減らす:音楽、通知音、もう一つの通話は、すべて同じシステム音声ストリームに入り込みます。
実際に使う予定のハードウェアで一度模擬面接を実施することが、本番前に自分の実際のエラー率を知る最も早い方法です。