Расшифровка звонка в текст: какая бывает точность и что на неё влияет
Точность расшифровки телефонного разговора в текст — это не фиксированная величина, а переменная, зависящая от многих факторов. Вендоры заявляют высокие проценты, но речь идёт об идеальных условиях. На реальных бизнес-звонках точность может быть ниже — из-за качества линии, перебиваний, отраслевых терминов и фонового шума. Однако её можно поднять: двухканальная запись, собственные словари терминов и разумные ожидания к именам собственным дают заметный прирост.
Откуда берутся заявленные проценты
MANGO OFFICE в продукте «Речевая аналитика» заявляет точность распознавания текста «достигает 95%». Но это заявление вендора, а не независимый замер. Обычно такие цифры получают на контрольных наборах данных — записях с хорошим качеством, без шума, с чёткой дикцией.
На телефонных записях реальных бизнес-звонков точность почти всегда ниже. Причины: сжатие аудио в кодеках, эхо, перебивания, акценты, отраслевой сленг. Независимых замеров точности на телефонных записях в открытых источниках мы не нашли, поэтому ориентироваться на заявленные 95% как на гарантию не стоит.
Yandex SpeechKit, который используется как движок распознавания в некоторых системах, не публикует единый процент точности — она зависит от языка, качества записи и терминологии. Тарифы известны (от 9 ₽ за час в отложенном режиме), а точность — ситуативная.
Что портит распознавание
Точность распознавания снижается из-за нескольких факторов.
- Качество линии и кодек сжатия. Многие АТС сильно сжимают аудио, чтобы экономить трафик. При сжатии теряются высокие частоты — именно они важны для распознавания согласных. Чем сильнее сжатие, тем больше ошибок.
- Перебивания и наложение речи. Когда говорят одновременно, системе сложно разделить реплики. Это проблема не только распознавания, но и диаризации — кто что сказал.
- Отраслевые термины и названия. Общий словарь не знает специфических слов. Если менеджер говорит «гидроабразивная резка» или «сервопривод», а словарь этого термина не содержит — вероятность ошибки высока.
- Фоновый шум. Уличный шум, музыка, голоса других людей — всё это ухудшает распознавание.
- Акценты и диалекты. Система обучена на литературной речи. С акцентом она справляется хуже.
Каждый из этих факторов по отдельности не критичен, но все вместе могут дать заметное снижение точности. Например, «назовите ваш номер телефона» может превратиться в «назавите ваш номел телефона» — для бизнес-логики это уже проблема.
Подробнее о транскрибации звонков — в статье транскрибация звонков в бизнесе.
Как поднять качество
Точность распознавания можно улучшить. Не до 100%, но ощутимо.
Двухканальная запись. Это самое важное. Если запись двухканальная — голос менеджера в одном канале, клиента в другом, — распознавание каждого канала работает лучше, чем если оба голоса в одном потоке. Кроме того, двухканальная запись даёт точную диаризацию — система точно знает, кто что сказал. Yandex SpeechKit в асинхронном режиме тарифицирует двухканальное аудио посекундно с 16-й секунды, минимум 15 секунд за каждые два канала.
Собственные словари терминов. Общие словари не знают отраслевых терминов, брендов, названий продуктов. Добавление своих терминов в словарь распознавания — один из самых эффективных способов поднять точность. MANGO OFFICE предлагает 32 бесплатных словаря, но для специфической отрасли может потребоваться доработка.
Разумные ожидания к именам собственным. Имена, фамилии, названия компаний система распознаёт хуже всего — особенно если они редкие или нетипичные для русского языка. Если в диалоге много имён, ожидать 95% не стоит. Для анализа чек-листов это не критично — важны глаголы и общая структура, а не точное написание имени.
В системе контроля продаж Аксиомы при подключении АТС разговоры записываются и расшифровываются в текст. Расшифровка попадает в общую систему анализа — туда же, где переписка из мессенджеров и голосовые сообщения. Но качество расшифровки зависит от качества записи, которое обеспечивает АТС компании. Подробнее о системе — на странице система контроля продаж.
Точность распознавания — не магия. Это результат работы движка, качества записи и настроек. Если вы хотите получить высокую точность — проверьте, даёт ли ваша АТС двухканальную запись с хорошим битрейтом. Если нет — это первое, что нужно исправить. Пилот на данных компании покажет реальную точность до подписания договора.
Вопросы про точность расшифровки
Какая точность распознавания телефонных звонков считается хорошей
Вендоры заявляют до 95%, но на реальных бизнес-звонках точность почти всегда ниже. Независимых замеров для телефонных записей в открытых источниках нет. Точность зависит от качества линии, перебиваний, терминов и шума.
Почему распознавание хуже на телефонных звонках, чем на записях с микрофона
Телефонные кодеки сильно сжимают аудио, теряя высокие частоты, важные для распознавания согласных. Также в звонках чаще встречаются перебивания, шум, акценты и отраслевые термины.
Как поднять точность распознавания телефонных звонков
Перейти на двухканальную запись (голос менеджера и клиента в разных каналах), добавить в словари отраслевые термины и названия, снизить ожидания по точности имён собственных.
Что важнее для анализа чек-листов — точность каждого слова или общая структура диалога
Для проверки чек-листов важнее общая структура: были ли вопросы о потребностях, назначен ли следующий шаг. Точное написание имён и редких терминов для этого не критично. Ошибки в редких словах не влияют на оценку выполнения скрипта.
Похожие материалы
Источники
- MANGO OFFICE — заявленная точность распознавания и словари — mango-office.ru
- Yandex SpeechKit — режимы распознавания и требования к аудио — aistudio.yandex.ru
Заявленная точность приведена как заявление вендора; независимых замеров точности на русских телефонных записях мы не нашли.