Funguje AI asistent pro pohovory s přízvuky?

Autor: Aaron Cao · Aktualizováno

Funguje AI asistent pro pohovory s přízvuky?
Obvykle ano, i když přesnost klesá u přízvuků, které jsou v trénovacích datech rozpoznávače málo zastoupeny. Nejdůležitější je přízvuk osoby vedoucí pohovor, protože právě její řeč spouští návrh. Neexistuje žádné nastavení pro jednotlivé přízvuky; regionální varianty angličtiny splývají do jediného akustického modelu.

Obvykle ano, i když přesnost klesá u přízvuků, které jsou v trénovacích datech rozpoznávače málo zastoupeny. Nejdůležitější je přízvuk osoby vedoucí pohovor, protože právě její řeč spouští návrh. Neexistuje žádné nastavení pro jednotlivé přízvuky; regionální varianty angličtiny splývají do jediného akustického modelu.

O čí přízvuk vlastně jde?

Otázka se dělí na dvě části a obě poloviny mají jinou odpověď. Váš přízvuk ovlivňuje, jak je přepisována vaše vlastní řeč. Přízvuk osoby vedoucí pohovor ovlivňuje, zda asistent porozuměl otázce, na kterou se chystá odpovědět, a právě tato polovina rozhoduje o tom, zda má návrh na vaší obrazovce vůbec nějakou cenu.

V desktopových aplikacích pro macOS a Windows se zachytávají obě strany: systémový zvuk přenáší osobu vedoucí pohovor, váš mikrofon přenáší vás a oba proudy jsou rozpoznávány odděleně. Nový návrh spouštějí pouze dokončené věty osoby vedoucí pohovor. Side Panel rozšíření prohlížeče toto ještě více zužuje tím, že zachytává pouze zvuk z karty schůzky, takže slyší jen osobu vedoucí pohovor a vás nikdy nepřepisuje. Pokud vás trápil právě váš vlastní přízvuk, rozšíření tento problém zcela odstraňuje.

Co rozpoznávač zohledňuje a co ne

Je rozumné předpokládat, že výběr jazyka zvolí i přízvuk a že někde existuje možnost indické nebo skotské angličtiny, kterou jste zatím jen nenašli. Není tomu tak. Nastavení jazyka vybírá jazyk a nic konkrétnějšího. Regionální varianty splývají dřív, než zvuk dorazí k rozpoznávači, takže britská a americká angličtina přicházejí jako stejný požadavek.

Co se skutečně děje automaticky: při výchozím automatickém rozpoznávání motor odvodí jazyk z prvních sekund řeči, místo aby vás nutil ho deklarovat. Přesnost u řeči s přízvukem vychází z toho, kolik z daného přízvuku bylo obsaženo v trénovacích datech rozpoznávacího modelu, což žádné nastavení neodhaluje a aplikace to nedokáže přepsat. Říct to na rovinu je lepší, než naznačovat, že existuje nějaký přepínač. Kde se nacházejí jazyková pole, je ukázáno na stránce tutoriálu.

Jak se chyba přepisu projeví na vaší obrazovce

Chyby jsou málokdy dramatické. Špatně slyšený odborný termín nebo vypadlá negace se promění v návrh, který je plynulý, sebejistý a odpovídá na něco, na co se osoba vedoucí pohovor vůbec neptala. Selhání je tiché, a právě proto stojí za to o něm vědět.

Aaron Cao, zakladatel SubcueAI, právě z tohoto důvodu umístil živý přepis na obrazovku vedle návrhu, místo aby ho skrýval. Vidět větu, o které si systém myslí, že ji slyšel, vám umožní zachytit nesoulad zhruba za sekundu, zatímco návrh bez viditelného přepisu by vás nechal spoléhat se na černou skříňku právě ve chvíli, kdy si to nejméně můžete dovolit.

Návyk, který stojí za vypěstování: nejdřív čtěte řádek přepisu, potom návrh. Když si odporují, vyhrávají vaše uši. Tomu, jak spolu souvisí zachytávání zvuku a generování odpovědí, se věnují stránky jak to funguje.

Co skutečně zlepšuje přesnost

Žádná z níže uvedených pák nemění akustický model a žádná z nich nezpůsobí, že se silný přízvuk přepisuje jako lehký. Co dělají, je odstraňovat chyby, které je ve vaší moci odstranit.

  • Headset místo reproduktorů: udržuje zvuk osoby vedoucí pohovor čistý a zabraňuje tomu, aby se zpět přepisovala ozvěna místnosti.
  • Tichá místnost: hovor na pozadí je zdroj chyb, který lidé podceňují, protože rozpoznávač neví, který hlas patří k pohovoru.
  • Uvedení jazyka místo spoléhání na automatické rozpoznání: pokud už víte, že pohovor bude probíhat v němčině, jeho uvedením se vyhnete kolísání rozpoznání v úvodních sekundách.
  • Méně paralelních zvukových zdrojů: hudba, zvuky upozornění a druhý hovor – to vše skončí ve stejném proudu systémového zvuku.

Spuštění jednoho zkušebního pohovoru přesně na hardwaru, který plánujete použít, je nejrychlejší způsob, jak zjistit svou skutečnou míru chyb dřív, než na tom bude záležet.

Časté dotazy

Rozumí silným přízvukům?

Obvykle ano, s vyšší mírou chyb než u lehce přízvučné řeči. Přesnost vychází z trénovacích dat rozpoznávacího modelu a žádné nastavení v aplikaci to nemění.

Existuje možnost indické nebo australské angličtiny?

Ne. Regionální varianty splývají do základního jazyka dřív, než zvuk dorazí k rozpoznávači, takže britská a americká angličtina běží na stejném akustickém modelu.

Ovlivňuje můj vlastní přízvuk návrhy odpovědí?

V desktopových aplikacích jsou návrhy spouštěny řečí osoby vedoucí pohovor, ne vaší. Side Panel rozšíření prohlížeče váš mikrofon vůbec nepřepisuje.

Co se stane, když je přepis nesprávný?

Návrh plynule odpoví na špatnou otázku. Přepis je umístěn vedle návrhu, abyste to mohli zachytit, a proto se vyplatí ta půlsekunda navíc na přečtení řádku přepisu jako první.

Mám použít automatické rozpoznání, nebo si zvolit jazyk sám?

Automatické rozpoznání funguje a na desktopu je výchozí. Explicitní uvedení jazyka se vyhne kolísání rozpoznání v úvodních sekundách, když už víte, v jakém jazyce pohovor probíhá.

Související otázky

← Více o Jak to funguje