Как работает речевая аналитика звонков: от записи до отчёта
Звонок записывается в АТС, система передаёт аудиофайл в движок распознавания речи, тот переводит его в текст. Затем текст проверяется по правилам и чек-листам, а на выходе формируется отчёт с оценками и проблемными местами.
Путь одного звонка — от записи до отчёта
Технический процесс включает пять последовательных этапов. На каждом звено либо преобразует данные, либо применяет к ним правило.
- Запись в АТС. Разговор фиксируется в аудиофайл. Обычно это двухканальная запись, где отдельно сохраняется речь менеджера и клиента.
- Передача в систему распознавания. Файл отправляется в API провайдера. Для потокового режима аудио передаётся по частям в реальном времени, для асинхронного — целиком, уже после разговора.
- Распознавание речи (ASR). Движок переводит аудио в текст. При потоковом режиме текст появляется почти синхронно с разговором; при асинхронном — через некоторое время после завершения звонка.
- Разбор по правилам и чек-листам. Готовый текст проверяется на наличие ключевых фраз, соблюдение скрипта, соотношение времени речи менеджера и клиента. Система отмечает, названа ли цена, назначен ли следующий шаг, задавались ли вопросы по потребности.
- Формирование отчёта. Результаты по всем диалогам за период собираются в сводный отчёт. В нём видны оценки по каждому менеджеру, цитаты проблемных фрагментов и общая картина по отделу.
В платформе контроль продаж с ИИ этот процесс встроен в общую систему управления продажами. Записи с подключённой АТС расшифровываются наравне с перепиской из мессенджеров и попадают в единую карточку клиента — менеджер не заводит данные вручную, руководитель видит все каналы коммуникации в одном отчёте.
Потоковое и отложенное распознавание
Движки распознавания речи предлагают два режима работы. Отличаются они не скоростью, а ценой и тем, как система обрабатывает аудио.
Потоковый режим — аудио передаётся по частям во время разговора. Текст появляется практически в реальном времени. Такой режим нужен, если результат требуется мгновенно, например для подсказок менеджеру или анализа тональности на лету.
Асинхронный режим — файл отправляется целиком после завершения разговора. Обработка может занять от нескольких секунд до минут в зависимости от загрузки сервиса. Для проверки звонков в отчётах за день или неделю этого времени достаточно.
В документации Yandex SpeechKit указаны следующие цены и правила тарификации для разных режимов:
| Режим | Цена за 15 секунд аудио | В пересчёте за минуту | Единица тарификации | Округление |
|---|---|---|---|---|
| Потоковый | 0,1626 ₽ | ~0,65 ₽ | 15 секунд одноканального аудио | Вверх до 15 секунд |
| Синхронный (файл) | 0,1626 ₽ | ~0,65 ₽ | 15 секунд одноканального аудио | Вверх до 15 секунд |
| Асинхронный (файл) | 0,1515 ₽ | ~0,61 ₽ | 1 секунда двухканального аудио | С 16-й секунды, посекундно |
| Асинхронный отложенный | 0,0381 ₽ | ~0,15 ₽ | 1 секунда двухканального аудио | С 16-й секунды, посекундно |
Разница в цене между потоковым (~0,65 ₽/мин) и асинхронным отложенным (~0,15 ₽/мин) — примерно вчетверо. Но есть нюансы.
В потоковом режиме тарификация начинается с отправки сообщения с настройками распознавания. Если аудио после этого не отправили, единица всё равно списывается. Пустой запрос тарифицируется как одна единица — 15 секунд.
В асинхронном режиме число каналов округляется до чётного, минимум — 15 секунд за каждые два канала. Это значит, что для одноканальной записи система может начислить больше, чем реальная длительность разговора.
Отложенный режим подходит для массовой обработки записей, когда результат не нужен сразу. Например, проверка всех звонков за прошедший день — отличный сценарий для асинхронного отложенного распознавания. Потоковый режим имеет смысл использовать только тогда, когда требуется мгновенная обратная связь — например, для интеграции с CRM в реальном времени.
Где система ошибается
Технология распознавания речи не даёт 100% точности. MANGO OFFICE заявляет, что точность распознавания текста «достигает 95%». Это означает: при хороших условиях система не распознаёт 5 из 100 слов. На практике ошибок может быть больше.
Основные источники ошибок:
- Шум на записи. Фоновые звуки, эхо, посторонние разговоры — всё это снижает качество распознавания. Особенно критично для уличных звонков или разговоров в открытом офисе.
- Перебивания. Когда менеджер и клиент говорят одновременно, система может неверно разделить реплики или потерять часть фразы.
- Редкие термины. Отраслевая лексика, аббревиатуры, имена собственные — слова, которые редко встречаются в обучающей выборке моделей.
- Акценты и диалекты. Модели распознавания тренируются на литературной речи. Региональное произношение или сильный акцент дают больше ошибок.
Для улучшения качества используются словари — списки ключевых слов и фраз, которые система должна распознавать точнее. В продукте MANGO OFFICE доступно 32 бесплатных словаря. Они помогают модели «догадаться» о произнесённом слове, даже если акустически оно распозналось неверно. Однако словари не исправляют ошибки, вызванные шумом или перебиваниями.
При этом ни один вендор не публикует независимые замеры точности на реальных записях из продаж. Цифра 95% — это заявление производителя, полученное, скорее всего, на чистых записях дикторской речи. На звонках в отделе продаж реальная точность может быть ниже.
MANGO OFFICE заявляет, что внедрение речевой аналитики занимает не более суток, а отчёты формируются за 15 минут. Это сроки, которые указывает вендор — они не учитывают настройку словарей под вашу отрасль и адаптацию чек-листов.
Вопросы про работу речевой аналитики
Что такое речевая аналитика звонков?
Это технология, которая автоматически расшифровывает разговоры в текст, проверяет их по чек-листам и формирует отчёт для руководителя. В отличие от прослушивания записей, система обрабатывает 100% звонков и показывает только проблемные диалоги с цитатами.
Чем отличается потоковое распознавание от асинхронного?
Потоковое — аудио передаётся по частям во время разговора, текст появляется почти в реальном времени. Асинхронное — файл отправляется целиком после разговора, результат готов через несколько секунд или минут. Отложенный режим дешевле потокового примерно в четыре раза: 0,0381 ₽ против 0,1626 ₽ за 15 секунд, то есть около 0,15 ₽ против 0,65 ₽ за минуту.
Какая точность распознавания у речевой аналитики?
MANGO OFFICE заявляет точность «до 95%». В реальных разговорах с шумом, акцентами и перебиваниями точность может быть ниже. Независимых замеров в открытом доступе нет.
На что обратить внимание в тарифах распознавания речи?
В потоковом режиме 1 секунда тарифицируется как 15 секунд — короткие звонки обходятся дороже. В асинхронном режиме число каналов округляется до чётного, одноканальная запись тарифицируется как двухканальная. Пустые запросы тоже оплачиваются.
Похожие материалы
Источники
- Yandex SpeechKit — правила тарификации и режимы распознавания речи — aistudio.yandex.ru
- MANGO OFFICE — «Речевая аналитика»: функции и заявленные характеристики — mango-office.ru
Режимы распознавания и правила тарификации приведены по официальной документации Yandex SpeechKit на 22.07.2026.