Продуктът
Колко точна е транскрипцията и как изобщо се мери
Числото „точност 95 процента“ почти нищо не значи, ако не знаете как е измерено. Какво е WER, какво крие и какво да питате, преди да повярвате.
- Публикувано
- Четене
- 4 мин
- Раздел
- Продуктът
Всеки доставчик на разпознаване на реч публикува число. Числата са високи и си приличат. После пускате своя запис и резултатът не прилича на обещаното. Причината не е задължително, че някой лъже: по-често е, че числото мери нещо друго, не вашата среща.
Струва си да разберете как се получава това число, защото след това ще знаете какво да питате.
WER: колкото по-малко, толкова по-добре
Стандартната мярка се казва word error rate, в превод дял на сгрешените думи. Смята се така:
WER = (заменени + пропуснати + добавени думи) / брой думи в еталона
Еталонът е човешки транскрипт на същия запис, за който приемаме, че е верен. Ако в изречение от 20 думи системата е сгрешила една, заменила е втора и е добавила трета, WER е 3 / 20, тоест 15 процента. „Точност 85 процента“ е същото число, обърнато наопаки.
Три неща правят този показател по-хлъзгав, отколкото изглежда.
Не всички грешки тежат еднакво. „Ще го направим в четвъртък“ вместо „в четвъртък ли ще го направим“ е една грешка при броенето и промяна на смисъла в разговора. Обратно, „ъъъ“ на място, където го е нямало, също е една грешка, а не значи нищо. WER брои и двете като едно.
Нормализацията крие или показва грешки. Преди сравнението текстовете се привеждат към общ вид: маха се пунктуацията, всичко става малки букви, числата се изписват по един начин. Колко агресивна е тази стъпка променя резултата с проценти. „15 октомври“ срещу „петнайсети октомври“ е или нула грешки, или две, според това как сте нормализирали.
Еталонът също е човешка работа. Двама души, които записват един и същ запис, се различават. При лош звук се различават много.
Защо чуждото число не важи за вашата среща
Публикуваните числа обикновено идват от стандартни набори записи: чист говор, един или двама говорители, четени или внимателно подбрани разговори. Вашата среща има:
- четирима души, от които двама говорят едновременно;
- имена на клиенти и продукти, които не съществуват в никакъв корпус;
- английски думи в български изречения;
- един участник на лоша връзка.
Всяко от тези неща вдига WER, и то различно за различните системи. Затова две системи с еднакво публикувано число могат да се държат съвсем различно при вас. За български има и допълнителен ефект: наборите за оценка са по-малки и по-малко разнообразни, отколкото за английски, така че числото стъпва на по-тясна основа.
Какво да питате, преди да повярвате на число
- На какъв запис е измерено? Стандартен набор или реални срещи.
- Колко говорители? Един говорител и четирима са различни задачи.
- Как е нормализиран текстът? Ако отговорът е неясен, числото е неясно.
- Броят ли се имената? Собствените имена са най-честият източник на грешки в делова среща, а някои оценки ги изключват.
- Какво става със смесения език? Български с английски термини вътре има собствен показател и той обикновено е по-лош от общия.
Ако на пет въпроса няма отговор, числото е реклама.
Защо ние още не публикуваме число
Държим набор от реални записи, срещу който мерим всяка промяна в обработката. Това е вътрешен инструмент и точно затова е полезен: сравнява днешната версия с вчерашната при еднакви условия.
Не публикуваме число от него, защото едно честно число иска и публикуван метод: какви записи, колко говорители, как е нормализирано, как са третирани имената и смесеният език. Без това число е просто по-голямо от чуждото, а такива числа вече има достатъчно.
Когато методът е готов за публикуване, ще излезе заедно с числото.
Какво правим вместо това
Три неща, които са по-полезни от процент:
Показваме къде не сме сигурни. Репликите, в които разпознаването не е било уверено, са отбелязани и се филтрират с едно натискане. Проверявате първо тях, вместо да четете всичко.
Даваме ви лост върху грешките. Речникът с имена и термини стига до разпознаването преди първата дума, а не поправя след това. Собствените имена са най-честата грешка и са и най-лесната за предотвратяване.
Не публикуваме цитат, който не се проверява. Когато моделът твърди, че решение е взето в минута 00:42, това време се показва само ако цитатът се потвърди в транскрипта. Ако не се потвърди, редът остава, а времето изчезва.
Най-полезното сравнение
Едночасова ваша среща, с вашите хора, вашите имена и вашия микрофон. Първият час е безплатен и не иска карта, точно за да можете да направите това сравнение, без да ни вярвате на дума.
Ако искате да подобрите резултата преди да съдите, прочетете какво работи добре и какво не в българската транскрипция.
Написано от екипа на Minuvo.
Свързана страница: Възможности: транскрипция и записки на български.