Ложный флаг аудита памяти: 3483 пары против 9 дублей
Ночной аудит выдал 3483 пары почти-одинакового текста по теме path. Настоящих дублей было 9. Разбираю, почему difflib врёт и как я починил метрику.
Парсинг — та область, где техническая часть редко бывает сложной, а результат всё равно получается не тот. Мы делали сбор данных с сайтов, маркетплейсов и сканов; ниже — где именно расходятся ожидания.
Главная неожиданность на живых задачах: собрать данные — половина дела. Вторая половина — понять, что в собранном мусор. Цена бывает в разных написаниях, названия — с опечатками, часть позиций дублируется, а неактуальные висят месяцами и выглядят как свежие.
Практический вывод: в брифе надо заранее договориться не о полях, а о правиле «это значение считаем достоверным». Иначе получите таблицу, которой нельзя пользоваться.
Там, где данные приходят картинками или PDF, распознавание можно держать у себя целиком: локальный OCR работает секунды на страницу и ничего не отправляет наружу. Это дороже по времени, чем облако, но данные не покидают машину — а в задачах со счетами и накладными это чаще важнее скорости.
Разовый сбор и постоянный мониторинг — разные по стоимости вещи. Разовый можно сделать за один проход. Мониторинг подразумевает расписание, историю изменений, хранение и — главное — уведомление только тогда, когда изменение значимо. Иначе поток оповещений обесценивает сам инструмент, и его перестают читать через неделю.
Про «сколько стоит парсинг сайта» честный ответ такой: разброс в разы, и определяется он не объёмом, а тем, сколько исключений придётся разбирать руками. Сбор с однотипного каталога и сбор с сайта, где у каждого региона своя вёрстка, — это два разных проекта при одинаковом числе строк в таблице.
Поэтому мы сначала смотрим не число страниц, а три вещи: стабильность вёрстки, наличие защиты от загрузки и то, как часто данные меняются.
Разброс в разы, и зависит не от числа страниц, а от того, сколько исключений придётся разбирать вручную: стабильность вёрстки, защита от загрузки, частота изменений данных.
Да, локальный OCR работает секунды на страницу и не отправляет данные наружу. Медленнее облака, но данные остаются на машине.
Ночной аудит выдал 3483 пары почти-одинакового текста по теме path. Настоящих дублей было 9. Разбираю, почему difflib врёт и как я починил метрику.
Десять участков работы с LLM в продукте — и что на каждом происходит у нас на самом деле: с цифрами цены, задержки и качества, а не пересказом чужих статей.
Мы не пишем «под ключ» и не обещаем позиций. Показываем, из чего собрана тема: частотность запросов из Wordstat, снятая 24.09.2026 по России.
| Запрос | Показов/мес |
|---|---|
| парсинг сайтов | 2 015 |
| парсинг сайтов конкурентов | 217 |
| парсинг номеров с сайтов | 149 |
| сколько стоит парсинг сайта | 16 |
| услуги парсинга сайтов | 13 |
Источник: Яндекс Wordstat, регион Россия, снято через API 24.09.2026. Цифры округлены провайдером до сотен.
Если задача — внедрение, а не чтение: напишите, разберём и скажем, стоит ли это делать вообще. Замеры под вашу задачу делаем до сметы.
Одно письмо, когда выходит новая статья или замер: разборы поломок, цифры цены и задержки, инструменты. Без рассылок «о нас» и без продаж. Отписаться можно ответом на любое письмо.