Работаю с ежедневными замерами, накопились наблюдения.
Работаем по трём странам, регионов в сумме больше тридцати. Держу два набора адресов, один под съём, второй под проверки.
Правильно ли я вообще ставлю вопрос?
Проверьте, что ответ полный.
Наступал на это в прошлом сезоне.
Глубину и частоту подбирайте под задачу. Ежедневный топ-100 по всему ядру это расход ради расхода, обычно хватает топ-20 каждый день и топ-100 раз в неделю.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Пробовали на другой машине?
Мы прогоняем похожие объёмы. Пул на шестьдесят адресов от адреса с безлимитным трафиком закрывает и съём, и мониторинг, при этом трафик не считаем вообще.
Уменьшите потоки вдвое и замерьте заново.
Держите запас, впритык не работает.
Один момент упущен, и он важный.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Полезный разбор получился.
Разбейте прогон на части, станет ровнее.
Расскажу, как выкручивались мы.
Съём для магазина на сотни тысяч страниц ведите по выборке. Полный охват тут не нужен: динамику показывает репрезентативная группа запросов.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
На всех площадках или на одной конкретной?
Данные теряются равномерно или кусками?
Добавлю то, что обычно вылезает на второй месяц работы.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
Если найдёте причину, поделитесь.
У нас это вылезло на проекте с большим каталогом.
Если данные утром оказались пустыми, смотрите запись результата. Сам прогон обычно проходит нормально. Чаще всего сбор прошёл, а сохранение упало на последнем шаге.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Смотрите подсети, число адресов само по себе мало что даёт.
У нас это вылезло на проекте с большим каталогом.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
Хороший вопрос, редко разбирают.
У нас это вылезло на проекте с большим каталогом.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Разбейте задачу на части.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.