AI面试助手能应对口音吗?
作者 Aaron Cao · 更新于

通常可以,但在识别引擎训练数据中占比较少的口音上,准确率会下降。最重要的是面试官的口音,因为正是他们的话语触发了建议的生成。系统没有针对特定口音的设置;各地区的英语变体都会归并到同一个声学模型中。
我们在讨论谁的口音?
这个问题其实分成两半,而两半的答案并不相同。你自己的口音会影响你的话语被转录的准确度;面试官的口音则决定了助手是否听懂了它即将回答的问题——而这一半,才是决定你屏幕上的建议是否有价值的关键。
在macOS和Windows桌面应用上,双方的声音都会被捕捉:系统音频负责捕捉面试官,麦克风负责捕捉你,两路声音分别独立识别。只有面试官说完的完整句子才会触发新的建议。浏览器扩展的侧边栏则把范围进一步收窄,只捕捉会议标签页的音频,因此它只听得到面试官,绝不会转录你的声音。如果你担心的正是自己的口音,这款扩展会彻底消除这个顾虑。
识别引擎会针对什么调整,又不会针对什么调整
你可能会理所当然地以为,选择语言的同时也选择了口音,以为在某个你还没找到的地方存在印度英语或苏格兰英语选项。并非如此。语言设置只选择语言,不会更细。区域变体在音频到达识别引擎之前就已经归并,因此英式英语和美式英语最终会以同一种请求形式送达。
真正自动发生的是:在默认的自动检测模式下,引擎会根据最初几秒的语音判断语言,而不需要你事先声明。带口音语音的准确率取决于这种口音在识别模型训练数据中所占的比例,这一点没有任何设置能够体现,应用也无法覆盖它。坦率说明这一点,好过暗示存在某种可调节的旋钮。语言字段的具体位置见教程页面。
转录错误会如何出现在你的屏幕上
错误很少是戏剧性的。一个被听错的专业术语,或一个被漏听的否定词,都会变成一句流畅、自信,却答非所问的建议。这种失误很安静,而正因为安静,才更值得了解。
正因如此,SubcueAI创始人Aaron Cao选择把实时转录文本显示在建议旁边,而不是隐藏起来。看到系统认为自己听到的那句话,能让你在大约一秒钟内发现不匹配之处;而如果没有可见的转录文本,你就只能在最经不起出错的时刻,去相信一个黑箱。
值得养成的习惯是:先读转录文本,再看建议。两者不一致时,以你的耳朵为准。捕捉与答案生成如何协同运作,在工作原理系列页面中有详细说明。
真正能提升准确率的方法
以下这些方法都不会改变声学模型本身,也不会让浓重口音像轻微口音一样被准确转录。它们能做到的,是消除那些本可以由你自己避免的错误。
- 用耳机代替扬声器:能让面试官的音频保持干净,避免房间回声被重新转录进去。
- 安静的房间:背景人声是人们最容易低估的错误来源,因为识别引擎并不知道哪个声音才是面试官。
- 手动指定语言而不是自动检测:如果你已经知道面试将用德语进行,提前说明可以避免开头几秒出现检测抖动。
- 减少并行音频来源:音乐、通知提示音和另一通电话,都会混进同一路系统音频流。
用你计划实际使用的硬件跑一次模拟面试,是在问题真正出现之前,了解自己真实错误率最快的方法。