AI面試助手能應對口音嗎?
作者 Aaron Cao · 更新於

通常可以,但在辨識引擎訓練資料中占比較少的口音上,準確率會下降。最重要的是面試官的口音,因為正是他們的話語觸發了建議的產生。系統沒有針對特定口音的設定;各地區的英語變體都會歸併到同一個聲學模型中。
我們在討論誰的口音?
這個問題其實分成兩半,而兩半的答案並不相同。你自己的口音會影響你的話語被轉錄的準確度;面試官的口音則決定了助手是否聽懂了它即將回答的問題——而這一半,才是決定你螢幕上的建議是否有價值的關鍵。
在macOS和Windows桌面應用程式上,雙方的聲音都會被擷取:系統音訊負責擷取面試官,麥克風負責擷取你,兩路聲音分別獨立辨識。只有面試官說完的完整句子才會觸發新的建議。瀏覽器擴充功能的側邊欄則把範圍進一步收窄,只擷取會議分頁的音訊,因此它只聽得到面試官,絕不會轉錄你的聲音。如果你擔心的正是自己的口音,這款擴充功能會徹底消除這個顧慮。
辨識引擎會針對什麼調整,又不會針對什麼調整
你可能會理所當然地以為,選擇語言的同時也選擇了口音,以為在某個你還沒找到的地方存在印度英語或蘇格蘭英語選項。並非如此。語言設定只選擇語言,不會更細。區域變體在音訊到達辨識引擎之前就已經歸併,因此英式英語和美式英語最終會以同一種請求形式送達。
真正自動發生的是:在預設的自動偵測模式下,引擎會根據最初幾秒的語音判斷語言,而不需要你事先聲明。帶口音語音的準確率取決於這種口音在辨識模型訓練資料中所占的比例,這一點沒有任何設定能夠體現,應用程式也無法覆寫它。坦率說明這一點,好過暗示存在某種可調節的旋鈕。語言欄位的具體位置見教學頁面。
轉錄錯誤會如何出現在你的螢幕上
錯誤很少是戲劇性的。一個被聽錯的專業術語,或一個被漏聽的否定詞,都會變成一句流暢、自信,卻答非所問的建議。這種失誤很安靜,而正因為安靜,才更值得了解。
正因如此,SubcueAI創辦人Aaron Cao選擇把即時轉錄文字顯示在建議旁邊,而不是隱藏起來。看到系統認為自己聽到的那句話,能讓你在大約一秒鐘內發現不吻合之處;而如果沒有可見的轉錄文字,你就只能在最經不起出錯的時刻,去相信一個黑箱。
值得養成的習慣是:先讀轉錄文字,再看建議。兩者不一致時,以你的耳朵為準。擷取與答案產生如何協同運作,在運作原理系列頁面中有詳細說明。
真正能提升準確率的方法
以下這些方法都不會改變聲學模型本身,也不會讓濃重口音像輕微口音一樣被準確轉錄。它們能做到的,是消除那些本可以由你自己避免的錯誤。
- 用耳機代替喇叭:能讓面試官的音訊保持乾淨,避免房間回音被重新轉錄進去。
- 安靜的房間:背景人聲是人們最容易低估的錯誤來源,因為辨識引擎並不知道哪個聲音才是面試官。
- 手動指定語言而不是自動偵測:如果你已經知道面試將用德語進行,提前說明可以避免開頭幾秒出現偵測抖動。
- 減少並行音訊來源:音樂、通知提示音和另一通電話,都會混進同一路系統音訊串流。
用你計畫實際使用的硬體跑一次模擬面試,是在問題真正出現之前,了解自己真實錯誤率最快的方法。