Trợ lý phỏng vấn AI có hiểu được giọng vùng miền không?
Bởi Aaron Cao · Cập nhật

Thường là có, dù độ chính xác giảm đối với những giọng ít xuất hiện trong dữ liệu huấn luyện của bộ nhận dạng. Giọng quan trọng nhất là giọng của người phỏng vấn, vì chính lời nói của họ mới kích hoạt gợi ý. Không có cài đặt riêng cho từng giọng; các biến thể tiếng Anh theo vùng đều được gộp về một mô hình âm học duy nhất.
Chúng ta đang nói về giọng của ai?
Câu hỏi này thực ra chia làm hai, và mỗi nửa có câu trả lời khác nhau. Giọng của bạn ảnh hưởng đến cách lời nói của chính bạn được chuyển thành văn bản. Giọng của người phỏng vấn ảnh hưởng đến việc trợ lý có hiểu đúng câu hỏi mà nó sắp trả lời hay không, và đây chính là nửa quyết định gợi ý hiện trên màn hình của bạn có giá trị hay không.
Trên các ứng dụng máy tính để bàn macOS và Windows, cả hai phía đều được ghi lại: âm thanh hệ thống mang giọng người phỏng vấn, micro mang giọng của bạn, và hai luồng này được nhận dạng riêng biệt. Chỉ những câu đã nói xong của người phỏng vấn mới kích hoạt gợi ý mới. Side Panel của tiện ích mở rộng trình duyệt thu hẹp phạm vi này hơn nữa, chỉ ghi lại âm thanh của tab cuộc họp, nên nó chỉ nghe người phỏng vấn và không bao giờ chuyển giọng nói của bạn thành văn bản. Nếu điều khiến bạn lo lắng chính là giọng của bản thân, thì tiện ích mở rộng này loại bỏ hoàn toàn nỗi lo đó.
Bộ nhận dạng điều chỉnh theo điều gì, và không điều chỉnh theo điều gì
Việc cho rằng chọn ngôn ngữ cũng đồng nghĩa với việc chọn giọng, và ở đâu đó bạn chưa tìm thấy có tùy chọn tiếng Anh Ấn Độ hay tiếng Anh Scotland, là điều hợp lý để nghĩ đến. Nhưng thực tế không phải vậy. Cài đặt ngôn ngữ chỉ chọn ngôn ngữ, không có gì chi tiết hơn. Các biến thể theo vùng được gộp lại trước khi âm thanh đến được bộ nhận dạng, nên tiếng Anh Anh và tiếng Anh Mỹ đến dưới dạng cùng một yêu cầu.
Điều thực sự diễn ra tự động là: với chế độ tự động nhận diện mặc định, công cụ này xác định ngôn ngữ từ vài giây nói đầu tiên thay vì bắt bạn phải khai báo. Độ chính xác đối với giọng nói có accent phụ thuộc vào việc giọng đó chiếm bao nhiêu trong dữ liệu huấn luyện của mô hình nhận dạng, điều mà không cài đặt nào hiển thị và ứng dụng cũng không thể ghi đè. Nói thẳng điều này tốt hơn là ngụ ý rằng có một nút điều chỉnh nào đó tồn tại. Vị trí của các trường ngôn ngữ được hiển thị trên trang hướng dẫn.
Lỗi chuyển giọng nói thành văn bản xuất hiện trên màn hình của bạn như thế nào
Lỗi hiếm khi mang tính kịch tính. Một thuật ngữ kỹ thuật bị nghe nhầm hay một từ phủ định bị bỏ sót có thể biến thành một gợi ý trôi chảy, đầy tự tin, nhưng lại trả lời một điều mà người phỏng vấn không hề hỏi. Sự cố này diễn ra âm thầm, và chính vì âm thầm nên nó mới đáng được biết đến.
Chính vì lý do này mà Aaron Cao, nhà sáng lập SubcueAI, đã đặt bản chuyển giọng nói trực tiếp lên màn hình bên cạnh gợi ý thay vì ẩn nó đi. Nhìn thấy câu mà hệ thống nghĩ rằng mình đã nghe được giúp bạn phát hiện sự sai lệch chỉ trong khoảng một giây, trong khi một gợi ý không kèm bản chuyển giọng nói hiển thị sẽ khiến bạn phải tin vào một hộp đen đúng vào lúc bạn ít có khả năng chấp nhận rủi ro đó nhất.
Thói quen đáng để xây dựng là: đọc dòng chuyển giọng nói trước, rồi mới đến gợi ý. Khi hai thứ không khớp nhau, hãy tin vào đôi tai của bạn. Cách việc ghi âm và tạo câu trả lời phối hợp với nhau được trình bày xuyên suốt các trang cách hoạt động.
Điều gì thực sự cải thiện độ chính xác
Không có biện pháp nào dưới đây thay đổi mô hình âm học, và cũng không có biện pháp nào khiến giọng nặng được chuyển thành văn bản tốt như giọng nhẹ. Điều chúng làm là loại bỏ những lỗi mà chính bạn có thể loại bỏ được.
- Dùng tai nghe thay vì loa: giữ cho âm thanh của người phỏng vấn sạch và ngăn tiếng vọng trong phòng bị chuyển ngược thành văn bản.
- Một căn phòng yên tĩnh: giọng nói nền là nguồn lỗi mà mọi người thường đánh giá thấp, vì bộ nhận dạng không biết giọng nào là giọng của cuộc phỏng vấn.
- Chỉ định ngôn ngữ thay vì để tự động nhận diện: nếu bạn đã biết trước cuộc phỏng vấn diễn ra bằng tiếng Đức, việc chỉ định trước sẽ tránh được hiện tượng dao động nhận diện trong vài giây đầu.
- Giảm số nguồn âm thanh chạy song song: nhạc, âm thanh thông báo và một cuộc gọi thứ hai đều lọt vào cùng một luồng âm thanh hệ thống.
Chạy thử một buổi phỏng vấn thử trên đúng phần cứng bạn dự định sử dụng là cách nhanh nhất để biết tỷ lệ lỗi thực tế của bạn trước khi nó thực sự quan trọng.
Câu hỏi thường gặp
Nó có hiểu được giọng nặng không?
Có tùy chọn tiếng Anh Ấn Độ hay tiếng Anh Úc không?
Giọng của chính tôi có ảnh hưởng đến các gợi ý trả lời không?
Điều gì xảy ra khi bản chuyển giọng nói bị sai?
Tôi nên dùng chế độ tự động nhận diện hay tự chọn ngôn ngữ?
Câu hỏi liên quan
- Chuyển đổi giọng nói thành văn bản phỏng vấn thời gian thực hoạt động như thế nào?
- Công cụ tạo câu trả lời phỏng vấn bằng AI là gì và hoạt động như thế nào?
- Nhà tuyển dụng có thể dùng trợ lý phỏng vấn AI khi ứng tuyển vào vị trí mới không?
- Trợ lý phỏng vấn AI thu âm hệ thống trên iOS như thế nào?
- Một trợ lý AI có thể giúp bạn đàm phán lương không?
- Những hạn chế thực sự của trợ lý AI phỏng vấn là gì?