Система речевой аналитики: из каких частей она состоит

Контроль продаж22.07.20262 источника~6 мин чтения

Речевая аналитика в продажах — это не одна программа, а цепочка из пяти узлов: источник записи, распознавание речи, разделение говорящих, слой правил и словарей, отчётность. Каждый узел выполняет свою задачу, и если на любом этапе случается сбой — вся цепочка даёт ошибку. Готовые компоненты (движки распознавания) берут у провайдеров, а словари, чек-листы и отчёты всегда настраивают под конкретную компанию. Самое слабое звено — качество исходной записи: плохая линия или одноканальный трек портят весь дальнейший анализ.

Пять узлов системы

Речевая аналитика состоит из пяти последовательных узлов. Каждый преобразует данные, и каждый может стать точкой отказа.

УзелЧто делаетЧто бывает не так
Источник записиЗахватывает аудио с АТС, мессенджеров или микрофонаПлохое качество, шум, потеря пакетов, одноканальная запись
Распознавание речи (ASR)Переводит речь в текстОшибки на акцентах, сленге, плохой записи
Разделение говорящих (диаризация)Определяет, кто и когда говоритПеребивания, одновременная речь, эхо
Слой правил и словарейПроверяет текст по чек-листам и словарямСловарь не знает терминов, правила не покрывают реальные сценарии
ОтчётностьФормирует сводки и показывает проблемные эпизодыОтчёты содержат много шума или не отвечают на вопросы руководителя

Рассмотрим каждый узел подробнее.

Источник записи. Это может быть АТС (для звонков), мессенджер (для голосовых сообщений) или приложение на смартфоне. Качество записи определяет всё дальнейшее. Если запись одноканальная (оба собеседника в одном потоке), диаризация идёт со сбоями. Если есть шум или эхо — падает точность распознавания.

Распознавание речи (ASR). Превращает звук в текст. Здесь используются движки вроде Yandex SpeechKit или 3iTech. MANGO OFFICE в продукте «Речевая аналитика» предлагает выбор между ними. Точность зависит от качества записи и терминологии. По данным вендора, точность достигает 95% — но это в идеальных условиях. На реальных звонках с акцентами и шумом она ниже.

Разделение говорящих (диаризация). Определяет, кто сказал каждую реплику — менеджер или клиент. Это важно для анализа: без диаризации система не знает, кто назвал цену рано или кто задавал вопросы. При перебиваниях или одновременной речи диаризация ошибается. Подробнее — в статье диаризация.

Слой правил и словарей. Это настройка под компанию. Словари содержат термины отрасли — без них система не распознаёт специфическую лексику. Чек-листы определяют, что считать нарушением: например, «цена названа до выяснения потребностей» или «не назначен следующий шаг». MANGO OFFICE предлагает 32 бесплатных словаря, но для сложных отраслей может потребоваться доработка.

Отчётность. Собирает результаты анализа и показывает руководителю проблемные эпизоды с цитатами. В Аксиоме ежедневный отчёт по менеджерам формируется автоматически. В MANGO OFFICE — за 15 минут, по данным вендора.

Что можно взять готовым, что придётся настраивать

Готовые компоненты — это движки распознавания речи. Yandex SpeechKit, 3iTech — их подключают как сервис. Не нужно разрабатывать свой ASR, это дорого и бессмысленно. Тарифы известны: у Yandex SpeechKit — от 9 ₽ за час аудио в отложенном режиме.

А вот всё, что выше распознавания, — настраивается под компанию. Словари, чек-листы, правила оценки, форматы отчётов. У каждой отрасли — своя терминология, у каждого отдела продаж — свои скрипты. Нельзя взять словарь «автосалон» для компании по производству станков или металлопроката. Нужна донастройка.

Интеграции тоже требуют работы. Речевая аналитика должна отдавать данные в CRM — amoCRM, Битрикс24, 1С и другие. Каждая интеграция настраивается индивидуально. MANGO OFFICE заявляет интеграции с большинством CRM, но конкретная конфигурация зависит от версии и кастомизации.

Слабое звено

Самое уязвимое место во всей цепочке — качество исходной записи. Если на входе плохой звук, никакой движок не исправит ошибку.

Что именно ломает систему:

  • Одноканальная запись. Менеджер и клиент записаны в один поток. Диаризация работает хуже, потому что не может опереться на разделение каналов. Асинхронное распознавание в Yandex SpeechKit работает с двухканальным аудио посекундно — если канал один, точность падает.
  • Шум и эхо. Ухудшают распознавание. Чем больше шума, тем больше ошибок в тексте.
  • Перебивания. Система не всегда может определить, кто говорит, когда собеседники перебивают друг друга.
  • Плохой кодек сжатия. Некоторые АТС сильно сжимают аудио, теряя частоты, важные для распознавания.

Поэтому перед внедрением речевой аналитики стоит проверить, какую запись даёт текущая АТС. Если качество низкое — либо менять настройки, либо планировать это как отдельную работу.

В системе контроля продаж Аксиомы при подключении АТС разговоры записываются и расшифровываются в текст, участвуют в отчётах и разборах. Но качество записи — ответственность владельца АТС. Убедитесь, что она даёт двухканальную запись с достаточным битрейтом. Иначе даже лучшая аналитика не поможет.

Речевая аналитика — это цепочка, и её прочность определяется самым слабым звеном. Проверьте качество записи до того, как подключать распознавание и настраивать отчёты. Пилот на данных компании — лучший способ убедиться, что все узлы работают вместе.

Вопросы про устройство системы

Из каких компонентов состоит система речевой аналитики

Из пяти узлов: источник записи (АТС или мессенджеры), распознавание речи в текст, разделение говорящих (диаризация), слой правил и словарей, отчётность. Каждый узел может стать точкой отказа.

Что в речевой аналитике можно взять готовым, а что нужно настраивать

Готовым — движки распознавания речи (Yandex SpeechKit, 3iTech). Настраивать — словари, чек-листы, правила оценки диалогов, форматы отчётов, интеграции с CRM. У каждой компании свои термины и скрипты.

Почему качество записи — самое слабое звено

Если на входе плохой звук (одноканальная запись, шум, эхо, перебивания), то даже лучший движок распознавания даст ошибки. Дальнейший анализ строится на тексте — если он неверен, то и отчёты неверны.

Что такое диаризация и зачем она нужна

Диаризация — это разделение реплик по говорящим. Система определяет, что сказал менеджер, а что — клиент. Без диаризации невозможно понять, кто назвал цену рано или кто не задал вопрос о потребностях.

Похожие материалы

Источники

  1. MANGO OFFICE — состав и функции «Речевой аналитики» — mango-office.ru
  2. Yandex SpeechKit — режимы распознавания речи и требования к аудио — aistudio.yandex.ru

Описание компонентов опирается на публичные страницы вендоров, сверенные 22.07.2026.