Диаризация: как система различает менеджера и клиента в записи

Контроль продаж22.07.20262 источника~5 мин чтения

Диаризация — это технология, которая автоматически определяет, кто из участников разговора говорит в каждый момент времени. Без неё речевая аналитика не может отличить реплики менеджера от слов клиента, а значит, большинство отчётов становятся бесполезными.

Зачем разделять говорящих

В записи звонка два голоса — менеджера и клиента. Они говорят по очереди, иногда перебивая друг друга. Чтобы проанализировать диалог, системе нужно понять, какая фраза кому принадлежит. Это и есть диаризация.

Без разделения говорящих невозможны ключевые отчёты речевой аналитики:

  • Доля речи менеджера. Сколько процентов времени говорит продавец, а сколько — клиент. Заметный перекос в сторону менеджера — повод послушать запись целиком. Без диаризации эта метрика просто не считается.
  • Кто назвал цену. Система проверяет, назвал ли менеджер стоимость или клиент спросил сам. Если цену называет клиент, это не засчитывается как выполнение скрипта.
  • Перебивания. Когда менеджер прерывает клиента, это видно по наложению реплик. Система может подсчитать количество и длительность перебиваний и включить их в отчёт.
  • Назначение следующего шага. Договорённость о встрече или звонке должна исходить от менеджера. Система проверяет, кто произнёс фразу «перезвоним» или «встречаемся».

В контроле продаж с ИИ диаризация встроена в общий контур. Аудиозаписи с подключённой АТС расшифровываются с разделением реплик, и отчёты по менеджерам строятся именно на основе этих данных, а не на общем тексте всего разговора.

Одноканальная и двухканальная запись

Качество диаризации зависит от того, как записан разговор. АТС может сохранять звонок в двух форматах.

ПараметрДвухканальная записьОдноканальная запись
Как хранитсяГолос менеджера и клиента — в разных каналах (стерео)Оба голоса — в одном канале (моно)
Надёжность диаризацииВысокая. Каналы физически разделены, ошибки почти исключеныНиже. Система разделяет голоса по акустическим признакам
Влияние на тарификацию (Yandex SpeechKit)В асинхронном режиме тарифицируется посекундно; число каналов округляется до чётногоВ синхронном/потоковом режиме — отрезки по 15 секунд, меньшее округляется вверх

Двухканальная запись надёжнее. Это связано с тем, что голоса физически записаны на разных дорожках — системе не нужно угадывать, кто сказал фразу. В одноканальной записи оба голоса смешаны, и алгоритм разделяет их по акустическим характеристикам: тембру, громкости, частоте. При шуме, эхе или похожих голосах ошибок становится больше.

Разный формат записи влияет на стоимость обработки. В синхронном и потоковом режиме Yandex SpeechKit единица тарификации — отрезок одноканального аудио длительностью 15 секунд. Если запись длится 1 секунду, система спишет 15. В асинхронном режиме единица — секунда двухканального аудио, с посекундной тарификацией с 16-й секунды. При этом число каналов округляется до чётного: одноканальная запись в асинхронном режиме будет тарифицироваться как двухканальная.

Что делать, если запись одноканальная

Большинство облачных сервисов, включая Yandex SpeechKit и 3iTech, поддерживают автоматическое разделение голосов в одноканальных записях. Это встроенная функция движка распознавания. Вам не нужно настраивать её отдельно — система сама определит, кто из двоих говорит в каждый момент.

Однако точность такого разделения ниже, чем при двухканальной записи. Сервисы используют алгоритмы, которые анализируют спектр голоса, паузы и перебивания. При идеальных условиях — тихо, голоса контрастные, говорят по очереди — качество диаризации приближается к двухканальной. В реальных разговорах с шумом, эхом и частыми перебиваниями ошибки неизбежны.

MANGO OFFICE заявляет точность распознавания текста «до 95%». Это общая цифра для всего процесса, включая диаризацию. Для одноканальной записи фактическая точность разделения может быть ниже.

При выборе сервиса уточняйте:

  • поддерживает ли он одноканальные записи или требует двухканальных;
  • можно ли указать количество говорящих (в диалоге их двое, но бывают конференции);
  • есть ли в отчётах метрики уверенности для каждой реплики — чтобы оценить качество диаризации.

Двухканальная запись требует поддержки со стороны АТС и настроек маршрутизации. Если ваша телефония пишет только моно, уточните у провайдера, можно ли переключиться на стереозапись. Это улучшит качество анализа без дополнительных затрат на обработку.

Вопросы про диаризацию

Что такое диаризация в речевой аналитике?

Это автоматическое разделение реплик в разговоре — система определяет, в какой момент говорит менеджер, а в какой клиент. Без этого нельзя посчитать долю речи, оценить перебивания или проверить, кто назвал цену.

Какая разница между одноканальной и двухканальной записью?

В двухканальной голоса менеджера и клиента записаны на разных дорожках, диаризация почти идеальна. В одноканальной голоса смешаны, система разделяет их по акустическим признакам — точность ниже.

Может ли система разделить голоса в одноканальной записи?

Да, облачные сервисы вроде Yandex SpeechKit поддерживают диаризацию одноканальных записей. Но точность будет ниже, чем при двухканальной, особенно при шуме, эхе или похожих голосах.

Влияет ли формат записи на стоимость распознавания?

Да. В асинхронном режиме Yandex SpeechKit единица тарификации — секунда двухканального аудио, число каналов округляется до чётного. Одноканальная запись тарифицируется как двухканальная, что может увеличить счёт.

Похожие материалы

Источники

  1. Yandex SpeechKit — тарификация и правила учёта каналов аудио — aistudio.yandex.ru
  2. MANGO OFFICE — поддержка одноканальных записей в «Речевой аналитике» — mango-office.ru

Правила учёта каналов аудио приведены по официальной документации Yandex SpeechKit на 22.07.2026.