Дубли в базе — это не про неряшливость. Это когда один и тот же человек получает два одинаковых письма, а вы платите за «двух клиентов» тарифу сервиса рассылок, который считает по числу контактов. Разобрали, откуда берутся дубли и как их искать — на реальных примерах опечаток, а не в общих словах.
Откуда берутся дубли на самом деле
Классический сценарий по Loginom: клиент авторизовался на сайте магазина, потом позвонил в колл-центр или пришёл в шоурум лично — и сотрудник вручную завёл его как нового клиента, не проверив базу. Добавьте сюда банальные различия в формате: «Александров Иван Сергеевич» и «Иван Сергеевич Александров» — для человека это очевидно один и тот же человек, для простого поиска по строке — два разных.
🪤 Находка: точный процент дублей — цифра, которую сложно проверить честно
В сети часто встречается конкретная цифра «10% дублей» как типичное значение. Мы попытались проверить её первоисточник напрямую — и не смогли: страница, на которую чаще всего ссылаются, при прямом заходе редиректит на общий блог без конкретной статьи. Loginom формулирует осторожнее — «десятки процентов» без точного числа. Мы выбрали процитировать более осторожную и проверяемую формулировку, а не более эффектную, но непроверяемую цифру.
Это ровно тот случай, когда «звучит солиднее» и «проверено» — разные вещи. Точный процент дублей у вас в базе зависит от того, сколько каналов входа вы используете (сайт, звонки, офлайн, маркетплейсы) — и узнать его можно только прогнав собственную базу через поиск дублей, а не взяв чужую усреднённую цифру.
Два способа искать дубли — и когда какой нужен
| Способ | Как работает | Когда достаточно |
|---|---|---|
| Точное совпадение | Ищет записи, идентичные буква в букву (телефон, email) | Быстрая первая чистка, большая база |
| Нечёткое сравнение | Метрики похожести (например, расстояние Левенштейна) находят похожие, не идентичные записи | Финальная точная чистка |
Точное совпадение — быстрый и дешёвый первый проход, но пропускает ровно те дубли, которые опаснее всего, потому что незаметны на глаз. Loginom приводит конкретные примеры опечаток, которые точное совпадение никогда не поймает:
| Что записано | Что имелось в виду | Причина |
|---|---|---|
| Ыедор | Федор | Опечатка на соседней клавише |
| Bdfy | Иван | Набор в неправильной раскладке клавиатуры |
| 74 АА 2 97530 | 74 АА 397530 | Случайный лишний символ |
Ни один из этих трёх случаев не поймает простой поиск «совпадает ли строка полностью» — а нечёткое сравнение находит именно такие похожие, но не идентичные записи.
Как дубли реально стоят денег, а не просто выглядят неаккуратно
По данным 1CRM, вред не абстрактный: тарифы большинства сервисов рассылок считаются по числу контактов — значит, дубли напрямую завышают счёт. Отправка одного и того же письма одному человеку дважды раздражает и портит впечатление сильнее, чем полное отсутствие письма. А главное — искажённая картина реального размера базы приводит к неверным управленческим решениям: вы можете думать, что у вас 5000 активных клиентов, а по факту — 4200 уникальных и 800 задвоенных карточек.
Что это значит на практике
Не пытайтесь ловить все дубли вручную глазами — примеры выше показывают, что часть из них человеческий взгляд пропускает систематически, не по невнимательности, а потому что «Ыедор» и «Bdfy» выглядят как случайный мусор, а не как узнаваемая ошибка. Начните с точного совпадения по телефону и email — это уберёт большую часть очевидных дублей быстро, а нечёткое сравнение оставьте на отдельный проход, когда база уже приведена в относительный порядок.
Ручной поиск дублей по строке — то, что быстро надоедает и потому откладывается на «когда-нибудь». В AXIOM дедупликация встроена в саму базу — карточки клиента объединяются автоматически по совпадению ключевых атрибутов, а не по ручной сверке таблицы раз в квартал.
Как устроена платформа →Вопросы, которые чаще всего задают про дубли в базе клиентов
Откуда вообще берутся дубли в базе клиентов?
Классический сценарий по Loginom: клиент зарегистрировался на сайте, потом позвонил в колл-центр или пришёл лично — и менеджер вручную завёл его как нового, не проверив, есть ли он уже в базе. Плюс банальные различия в формате записи ФИО.
Сколько дублей обычно бывает в базе клиентов?
Честный ответ — «десятки процентов», без более точной цифры. Более конкретные проценты, которые встречаются в сети, не выдержали прямой проверки источника при подготовке этого материала, поэтому мы их не используем.
Чем «точное совпадение» отличается от «нечёткого сравнения» при поиске дублей?
Точное совпадение ищет записи, где данные совпадают буква в букву — быстро, но пропускает опечатки. Нечёткое сравнение находит похожие, но не идентичные записи — например, «Ыедор» вместо «Федор» из-за соседних клавиш.
Какие типичные опечатки создают скрытые дубли?
Опечатки на соседних клавишах, смешение похожих русских и латинских букв, набор текста в неправильной раскладке клавиатуры (Bdfy вместо Иван). Человеческий глаз такие дубли видит не всегда с первого взгляда.
Как дубли реально вредят бизнесу, а не просто выглядят неряшливо?
Лишние затраты на хранение и на тарифы сервисов рассылки, которые считают по числу контактов, риск отправить одному человеку несколько одинаковых писем, и управленческие решения на основе искажённой картины размера базы.
Продукт по теме
Похожие материалы
Источники
- Loginom — «Как найти и объединить дубли клиентов» — опубл. 13.03.2020 — loginom.ru — как найти и объединить дубли клиентов
- 1CRM — «Что такое дубли клиентской базы и почему они вредят бизнесу» — media.1crm.ru — как дубли вредят бизнесу
Не использован: blog.hflabs.ru — страница, на которую массово ссылаются другие статьи с цифрой «10% дублей», при прямом заходе редиректит (301) на общий блог без конкретной статьи. Первоисточник цифры не подтверждён — цифра не включена в статью.