Система речевой аналитики: из каких частей она состоит
Речевая аналитика в продажах — это не одна программа, а цепочка из пяти узлов: источник записи, распознавание речи, разделение говорящих, слой правил и словарей, отчётность. Каждый узел выполняет свою задачу, и если на любом этапе случается сбой — вся цепочка даёт ошибку. Готовые компоненты (движки распознавания) берут у провайдеров, а словари, чек-листы и отчёты всегда настраивают под конкретную компанию. Самое слабое звено — качество исходной записи: плохая линия или одноканальный трек портят весь дальнейший анализ.
Пять узлов системы
Речевая аналитика состоит из пяти последовательных узлов. Каждый преобразует данные, и каждый может стать точкой отказа.
| Узел | Что делает | Что бывает не так |
|---|---|---|
| Источник записи | Захватывает аудио с АТС, мессенджеров или микрофона | Плохое качество, шум, потеря пакетов, одноканальная запись |
| Распознавание речи (ASR) | Переводит речь в текст | Ошибки на акцентах, сленге, плохой записи |
| Разделение говорящих (диаризация) | Определяет, кто и когда говорит | Перебивания, одновременная речь, эхо |
| Слой правил и словарей | Проверяет текст по чек-листам и словарям | Словарь не знает терминов, правила не покрывают реальные сценарии |
| Отчётность | Формирует сводки и показывает проблемные эпизоды | Отчёты содержат много шума или не отвечают на вопросы руководителя |
Рассмотрим каждый узел подробнее.
Источник записи. Это может быть АТС (для звонков), мессенджер (для голосовых сообщений) или приложение на смартфоне. Качество записи определяет всё дальнейшее. Если запись одноканальная (оба собеседника в одном потоке), диаризация идёт со сбоями. Если есть шум или эхо — падает точность распознавания.
Распознавание речи (ASR). Превращает звук в текст. Здесь используются движки вроде Yandex SpeechKit или 3iTech. MANGO OFFICE в продукте «Речевая аналитика» предлагает выбор между ними. Точность зависит от качества записи и терминологии. По данным вендора, точность достигает 95% — но это в идеальных условиях. На реальных звонках с акцентами и шумом она ниже.
Разделение говорящих (диаризация). Определяет, кто сказал каждую реплику — менеджер или клиент. Это важно для анализа: без диаризации система не знает, кто назвал цену рано или кто задавал вопросы. При перебиваниях или одновременной речи диаризация ошибается. Подробнее — в статье диаризация.
Слой правил и словарей. Это настройка под компанию. Словари содержат термины отрасли — без них система не распознаёт специфическую лексику. Чек-листы определяют, что считать нарушением: например, «цена названа до выяснения потребностей» или «не назначен следующий шаг». MANGO OFFICE предлагает 32 бесплатных словаря, но для сложных отраслей может потребоваться доработка.
Отчётность. Собирает результаты анализа и показывает руководителю проблемные эпизоды с цитатами. В Аксиоме ежедневный отчёт по менеджерам формируется автоматически. В MANGO OFFICE — за 15 минут, по данным вендора.
Что можно взять готовым, что придётся настраивать
Готовые компоненты — это движки распознавания речи. Yandex SpeechKit, 3iTech — их подключают как сервис. Не нужно разрабатывать свой ASR, это дорого и бессмысленно. Тарифы известны: у Yandex SpeechKit — от 9 ₽ за час аудио в отложенном режиме.
А вот всё, что выше распознавания, — настраивается под компанию. Словари, чек-листы, правила оценки, форматы отчётов. У каждой отрасли — своя терминология, у каждого отдела продаж — свои скрипты. Нельзя взять словарь «автосалон» для компании по производству станков или металлопроката. Нужна донастройка.
Интеграции тоже требуют работы. Речевая аналитика должна отдавать данные в CRM — amoCRM, Битрикс24, 1С и другие. Каждая интеграция настраивается индивидуально. MANGO OFFICE заявляет интеграции с большинством CRM, но конкретная конфигурация зависит от версии и кастомизации.
Слабое звено
Самое уязвимое место во всей цепочке — качество исходной записи. Если на входе плохой звук, никакой движок не исправит ошибку.
Что именно ломает систему:
- Одноканальная запись. Менеджер и клиент записаны в один поток. Диаризация работает хуже, потому что не может опереться на разделение каналов. Асинхронное распознавание в Yandex SpeechKit работает с двухканальным аудио посекундно — если канал один, точность падает.
- Шум и эхо. Ухудшают распознавание. Чем больше шума, тем больше ошибок в тексте.
- Перебивания. Система не всегда может определить, кто говорит, когда собеседники перебивают друг друга.
- Плохой кодек сжатия. Некоторые АТС сильно сжимают аудио, теряя частоты, важные для распознавания.
Поэтому перед внедрением речевой аналитики стоит проверить, какую запись даёт текущая АТС. Если качество низкое — либо менять настройки, либо планировать это как отдельную работу.
В системе контроля продаж Аксиомы при подключении АТС разговоры записываются и расшифровываются в текст, участвуют в отчётах и разборах. Но качество записи — ответственность владельца АТС. Убедитесь, что она даёт двухканальную запись с достаточным битрейтом. Иначе даже лучшая аналитика не поможет.
Речевая аналитика — это цепочка, и её прочность определяется самым слабым звеном. Проверьте качество записи до того, как подключать распознавание и настраивать отчёты. Пилот на данных компании — лучший способ убедиться, что все узлы работают вместе.
Вопросы про устройство системы
Из каких компонентов состоит система речевой аналитики
Из пяти узлов: источник записи (АТС или мессенджеры), распознавание речи в текст, разделение говорящих (диаризация), слой правил и словарей, отчётность. Каждый узел может стать точкой отказа.
Что в речевой аналитике можно взять готовым, а что нужно настраивать
Готовым — движки распознавания речи (Yandex SpeechKit, 3iTech). Настраивать — словари, чек-листы, правила оценки диалогов, форматы отчётов, интеграции с CRM. У каждой компании свои термины и скрипты.
Почему качество записи — самое слабое звено
Если на входе плохой звук (одноканальная запись, шум, эхо, перебивания), то даже лучший движок распознавания даст ошибки. Дальнейший анализ строится на тексте — если он неверен, то и отчёты неверны.
Что такое диаризация и зачем она нужна
Диаризация — это разделение реплик по говорящим. Система определяет, что сказал менеджер, а что — клиент. Без диаризации невозможно понять, кто назвал цену рано или кто не задал вопрос о потребностях.
Похожие материалы
Источники
- MANGO OFFICE — состав и функции «Речевой аналитики» — mango-office.ru
- Yandex SpeechKit — режимы распознавания речи и требования к аудио — aistudio.yandex.ru
Описание компонентов опирается на публичные страницы вендоров, сверенные 22.07.2026.