Разметил 94 сайта скриптом и трижды ошибся в свою пользу
Автоматическая разметка ошибается не случайно, а систематически и в одну сторону. Дмитрий Франтлас, автор проекта о франшизах, разметил скриптом 94 сайта, проверил цитаты глазами и нашёл три типовые ошибки: после правок две ключевые цифры упали вдвое.

Контент-анализ конкурентов обычно выглядит так: берём список сайтов, пишем скрипт, который ищет нужные слова, получаем проценты. Дальше проценты идут в презентацию, в статью или в стратегию.
Я делаю такие разборы для своих материалов и вчера расширил выборку с 15 сайтов до 94. Заодно добавил новые признаки. Первая же выгрузка дала красивые цифры, и почти каждая из них оказалась завышенной.
Рассказываю, где именно скрипт соврал, потому что ошибки эти не мои личные, а типовые: они возникают в любой разметке по словам.
Ошибка первая: слово нашлось, смысл другой
Я считал, сколько сайтов прямо гарантируют доход. Скрипт искал корень «гарант» рядом с деньгами. Получилось 32 из 94.

Пошёл смотреть цитаты и нашёл вот что:
- «гарантия на оборудование 12 месяцев» — гарантийное обслуживание;
- «стабильность поставок гарантирует получение прибыли» — обещание про поставки;
- «это гарантирует поток клиентов» — обещание про клиентов, денег рядом нет;
- «гарантии, преимущества, калькулятор прибыли» — пункты меню сайта.
Ни один из этих случаев не является гарантией дохода, ради которой затевался подсчёт. Слово одно, смысл разный.
Ошибка вторая: отрицание засчиталось как утверждение
Эта тише и опаснее. На нескольких страницах скрипт нашёл «гарантию» там, где стояло ровно обратное:
- «предварительный расчёт, не гарантирует доход»;
- «расчётные показатели, не являются гарантией».
Это оговорки — то самое, чего на большинстве страниц как раз не хватает. А в моей таблице они пополнили колонку «гарантируют доход». То есть признак считал в свою пользу дважды: и когда обещание было, и когда его специально снимали.
После того как отрицания отсеклись, а ложные срабатывания я снял руками, осталось 14 сайтов из 94 вместо 32. Цифра упала более чем вдвое.
Ошибка третья: слишком широкое окно
Третий признак считал, называют ли на сайте срок поддержки после открытия: «сопровождение 12 месяцев», «обучение 5 дней». Скрипт искал слово о поддержке и число с единицей времени в пределах 90 знаков.
Девяносто знаков — это примерно полтора предложения, и в них попадает много лишнего. Например, номер пункта в списке: «7. Открытие» стояло рядом со словом «сопровождение», и страница засчитывалась как назвавшая срок.
Я сузил окно до сорока знаков и потребовал, чтобы число стояло вплотную к слову. Было 35 сайтов из 94, стало 17.
Схема трёх ошибок разметки: слово нашлось, а смысл другой — было 32 сайта, стало 14; отрицание засчитывалось как утверждение; слишком широкое окно поиска — было 35, стало 17.
Что в итоге и почему это важно
Три правки — и три цифры из моего разбора изменились вдвое. Если бы я опубликовал первую выгрузку, читатель получил бы завышенные проценты, а я бы об этом не узнал: итоги выглядели правдоподобно.
Правдоподобность — главная ловушка автоматической разметки. Скрипт не ошибается случайно, он ошибается систематически и в одну сторону. Слово находится чаще, чем встречается смысл, поэтому почти всегда завышается именно то, что вы хотели показать.
Как проверять свою разметку
Порядок, к которому я пришёл:
- Смотреть цитаты, а не итоги. Скрипт должен сохранять фрагмент текста вокруг каждого срабатывания. Без этого проверить нечего.
- Читать глазами по десять примеров на признак. Не все, но достаточно, чтобы увидеть системную ошибку. Три моих нашлись именно так.
- Отдельно искать отрицания. «Не гарантирует», «не является», «без учёта» — проверьте каждый признак на то, что будет, если рядом стоит отрицание.
- Считать окно в знаках, а не на глаз. Чем шире окно, тем больше ложных совпадений, и растут они незаметно.
- Вести файл ручных правок. У меня это отдельный список: страница, признак, цитата, причина. Он же объясняет расхождение между автоматической выгрузкой и итогом, если кто-то спросит.
- Публиковать границы выборки рядом с цифрами. Откуда взялись адреса, сколько отсеяно, что именно считается признаком.
Что с этим делать, если считаете не вы
Если разбор делает подрядчик или нейросеть, спрашивайте не проценты, а три вещи: как звучало правило, сколько случаев проверено руками и что именно поправлено. Ответ «скрипт посчитал» означает, что цифры никто не видел.
Мой замер, о котором речь, сделан 22 сентября 2026 года: 94 посадочные страницы, адреса из живой поисковой выдачи, тринадцать случаев поправлено вручную. Выборка не случайная, и я пишу это рядом с каждой цифрой.




Комментарии