Расшифровка звонка в текст: какая бывает точность и что на неё влияет

Контроль продаж22.07.20262 источника~6 мин чтения

Точность расшифровки телефонного разговора в текст — это не фиксированная величина, а переменная, зависящая от многих факторов. Вендоры заявляют высокие проценты, но речь идёт об идеальных условиях. На реальных бизнес-звонках точность может быть ниже — из-за качества линии, перебиваний, отраслевых терминов и фонового шума. Однако её можно поднять: двухканальная запись, собственные словари терминов и разумные ожидания к именам собственным дают заметный прирост.

Откуда берутся заявленные проценты

MANGO OFFICE в продукте «Речевая аналитика» заявляет точность распознавания текста «достигает 95%». Но это заявление вендора, а не независимый замер. Обычно такие цифры получают на контрольных наборах данных — записях с хорошим качеством, без шума, с чёткой дикцией.

На телефонных записях реальных бизнес-звонков точность почти всегда ниже. Причины: сжатие аудио в кодеках, эхо, перебивания, акценты, отраслевой сленг. Независимых замеров точности на телефонных записях в открытых источниках мы не нашли, поэтому ориентироваться на заявленные 95% как на гарантию не стоит.

Yandex SpeechKit, который используется как движок распознавания в некоторых системах, не публикует единый процент точности — она зависит от языка, качества записи и терминологии. Тарифы известны (от 9 ₽ за час в отложенном режиме), а точность — ситуативная.

Что портит распознавание

Точность распознавания снижается из-за нескольких факторов.

  • Качество линии и кодек сжатия. Многие АТС сильно сжимают аудио, чтобы экономить трафик. При сжатии теряются высокие частоты — именно они важны для распознавания согласных. Чем сильнее сжатие, тем больше ошибок.
  • Перебивания и наложение речи. Когда говорят одновременно, системе сложно разделить реплики. Это проблема не только распознавания, но и диаризации — кто что сказал.
  • Отраслевые термины и названия. Общий словарь не знает специфических слов. Если менеджер говорит «гидроабразивная резка» или «сервопривод», а словарь этого термина не содержит — вероятность ошибки высока.
  • Фоновый шум. Уличный шум, музыка, голоса других людей — всё это ухудшает распознавание.
  • Акценты и диалекты. Система обучена на литературной речи. С акцентом она справляется хуже.

Каждый из этих факторов по отдельности не критичен, но все вместе могут дать заметное снижение точности. Например, «назовите ваш номер телефона» может превратиться в «назавите ваш номел телефона» — для бизнес-логики это уже проблема.

Подробнее о транскрибации звонков — в статье транскрибация звонков в бизнесе.

Как поднять качество

Точность распознавания можно улучшить. Не до 100%, но ощутимо.

Двухканальная запись. Это самое важное. Если запись двухканальная — голос менеджера в одном канале, клиента в другом, — распознавание каждого канала работает лучше, чем если оба голоса в одном потоке. Кроме того, двухканальная запись даёт точную диаризацию — система точно знает, кто что сказал. Yandex SpeechKit в асинхронном режиме тарифицирует двухканальное аудио посекундно с 16-й секунды, минимум 15 секунд за каждые два канала.

Собственные словари терминов. Общие словари не знают отраслевых терминов, брендов, названий продуктов. Добавление своих терминов в словарь распознавания — один из самых эффективных способов поднять точность. MANGO OFFICE предлагает 32 бесплатных словаря, но для специфической отрасли может потребоваться доработка.

Разумные ожидания к именам собственным. Имена, фамилии, названия компаний система распознаёт хуже всего — особенно если они редкие или нетипичные для русского языка. Если в диалоге много имён, ожидать 95% не стоит. Для анализа чек-листов это не критично — важны глаголы и общая структура, а не точное написание имени.

В системе контроля продаж Аксиомы при подключении АТС разговоры записываются и расшифровываются в текст. Расшифровка попадает в общую систему анализа — туда же, где переписка из мессенджеров и голосовые сообщения. Но качество расшифровки зависит от качества записи, которое обеспечивает АТС компании. Подробнее о системе — на странице система контроля продаж.

Точность распознавания — не магия. Это результат работы движка, качества записи и настроек. Если вы хотите получить высокую точность — проверьте, даёт ли ваша АТС двухканальную запись с хорошим битрейтом. Если нет — это первое, что нужно исправить. Пилот на данных компании покажет реальную точность до подписания договора.

Вопросы про точность расшифровки

Какая точность распознавания телефонных звонков считается хорошей

Вендоры заявляют до 95%, но на реальных бизнес-звонках точность почти всегда ниже. Независимых замеров для телефонных записей в открытых источниках нет. Точность зависит от качества линии, перебиваний, терминов и шума.

Почему распознавание хуже на телефонных звонках, чем на записях с микрофона

Телефонные кодеки сильно сжимают аудио, теряя высокие частоты, важные для распознавания согласных. Также в звонках чаще встречаются перебивания, шум, акценты и отраслевые термины.

Как поднять точность распознавания телефонных звонков

Перейти на двухканальную запись (голос менеджера и клиента в разных каналах), добавить в словари отраслевые термины и названия, снизить ожидания по точности имён собственных.

Что важнее для анализа чек-листов — точность каждого слова или общая структура диалога

Для проверки чек-листов важнее общая структура: были ли вопросы о потребностях, назначен ли следующий шаг. Точное написание имён и редких терминов для этого не критично. Ошибки в редких словах не влияют на оценку выполнения скрипта.

Похожие материалы

Источники

  1. MANGO OFFICE — заявленная точность распознавания и словари — mango-office.ru
  2. Yandex SpeechKit — режимы распознавания и требования к аудио — aistudio.yandex.ru

Заявленная точность приведена как заявление вендора; независимых замеров точности на русских телефонных записях мы не нашли.