Продуктът

Колко точна е транскрипцията и как изобщо се мери

Числото „точност 95 процента“ почти нищо не значи, ако не знаете как е измерено. Какво е WER, какво крие и какво да питате, преди да повярвате.

Публикувано
Четене
4 мин
Раздел
Продуктът

Всеки доставчик на разпознаване на реч публикува число. Числата са високи и си приличат. После пускате своя запис и резултатът не прилича на обещаното. Причината не е задължително, че някой лъже: по-често е, че числото мери нещо друго, не вашата среща.

Струва си да разберете как се получава това число, защото след това ще знаете какво да питате.

WER: колкото по-малко, толкова по-добре

Стандартната мярка се казва word error rate, в превод дял на сгрешените думи. Смята се така:

WER = (заменени + пропуснати + добавени думи) / брой думи в еталона

Еталонът е човешки транскрипт на същия запис, за който приемаме, че е верен. Ако в изречение от 20 думи системата е сгрешила една, заменила е втора и е добавила трета, WER е 3 / 20, тоест 15 процента. „Точност 85 процента“ е същото число, обърнато наопаки.

Три неща правят този показател по-хлъзгав, отколкото изглежда.

Не всички грешки тежат еднакво. „Ще го направим в четвъртък“ вместо „в четвъртък ли ще го направим“ е една грешка при броенето и промяна на смисъла в разговора. Обратно, „ъъъ“ на място, където го е нямало, също е една грешка, а не значи нищо. WER брои и двете като едно.

Нормализацията крие или показва грешки. Преди сравнението текстовете се привеждат към общ вид: маха се пунктуацията, всичко става малки букви, числата се изписват по един начин. Колко агресивна е тази стъпка променя резултата с проценти. „15 октомври“ срещу „петнайсети октомври“ е или нула грешки, или две, според това как сте нормализирали.

Еталонът също е човешка работа. Двама души, които записват един и същ запис, се различават. При лош звук се различават много.

Защо чуждото число не важи за вашата среща

Публикуваните числа обикновено идват от стандартни набори записи: чист говор, един или двама говорители, четени или внимателно подбрани разговори. Вашата среща има:

  • четирима души, от които двама говорят едновременно;
  • имена на клиенти и продукти, които не съществуват в никакъв корпус;
  • английски думи в български изречения;
  • един участник на лоша връзка.

Всяко от тези неща вдига WER, и то различно за различните системи. Затова две системи с еднакво публикувано число могат да се държат съвсем различно при вас. За български има и допълнителен ефект: наборите за оценка са по-малки и по-малко разнообразни, отколкото за английски, така че числото стъпва на по-тясна основа.

Какво да питате, преди да повярвате на число

  1. На какъв запис е измерено? Стандартен набор или реални срещи.
  2. Колко говорители? Един говорител и четирима са различни задачи.
  3. Как е нормализиран текстът? Ако отговорът е неясен, числото е неясно.
  4. Броят ли се имената? Собствените имена са най-честият източник на грешки в делова среща, а някои оценки ги изключват.
  5. Какво става със смесения език? Български с английски термини вътре има собствен показател и той обикновено е по-лош от общия.

Ако на пет въпроса няма отговор, числото е реклама.

Защо ние още не публикуваме число

Държим набор от реални записи, срещу който мерим всяка промяна в обработката. Това е вътрешен инструмент и точно затова е полезен: сравнява днешната версия с вчерашната при еднакви условия.

Не публикуваме число от него, защото едно честно число иска и публикуван метод: какви записи, колко говорители, как е нормализирано, как са третирани имената и смесеният език. Без това число е просто по-голямо от чуждото, а такива числа вече има достатъчно.

Когато методът е готов за публикуване, ще излезе заедно с числото.

Какво правим вместо това

Три неща, които са по-полезни от процент:

Показваме къде не сме сигурни. Репликите, в които разпознаването не е било уверено, са отбелязани и се филтрират с едно натискане. Проверявате първо тях, вместо да четете всичко.

Даваме ви лост върху грешките. Речникът с имена и термини стига до разпознаването преди първата дума, а не поправя след това. Собствените имена са най-честата грешка и са и най-лесната за предотвратяване.

Не публикуваме цитат, който не се проверява. Когато моделът твърди, че решение е взето в минута 00:42, това време се показва само ако цитатът се потвърди в транскрипта. Ако не се потвърди, редът остава, а времето изчезва.

Най-полезното сравнение

Едночасова ваша среща, с вашите хора, вашите имена и вашия микрофон. Първият час е безплатен и не иска карта, точно за да можете да направите това сравнение, без да ни вярвате на дума.

Ако искате да подобрите резултата преди да съдите, прочетете какво работи добре и какво не в българската транскрипция.

Написано от екипа на Minuvo.

Свързана страница: Възможности: транскрипция и записки на български.

Вижте записките от една ваша среща.

Първият час е безплатен и не иска карта. Как работи.

Запишете първия си час