Задача обычная, а вопрос упирается в цифры, которые каждый называет свои.
Условия задачи вот такие.
На узких регионах данных мало, и это отдельная головная боль. Пробовал разносить прогон по времени, картина поменялась, но не полностью. Держу 60 адресов, потоков ставлю 120, глубина топ-50.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Подскажите, с чего начать разбор.
На такой задаче адреса надо держать свои. Общий пул тут подведёт. Общий пул делится с незнакомыми людьми, и лимит вы никогда не контролируете. Я беру приватный пул IPv4 и сплю спокойно.
Половина верна, вторую половину поправлю.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Мы упирались в то же, пока не поменяли подход.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Отпишитесь, чем закончится, тема полезная.
У нас это вылезло на проекте с большим каталогом.
Глубину и частоту подбирайте под задачу. Ежедневный топ-100 по всему ядру это расход ради расхода, обычно хватает топ-20 каждый день и топ-100 раз в неделю.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Так делать можно, но есть путь короче.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
Проверял на четырёх проектах, вывод один.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
Первый раз списал на случайность, второй раз уже нет.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Осторожнее с этим выводом, он верен не всегда.
Историю позиций храните с отметкой, каким набором адресов и в какое время снято. Без этого спорить о расхождениях невозможно.
Глубину и частоту подбирайте под задачу. Ежедневный топ-100 по всему ядру это расход ради расхода, обычно хватает топ-20 каждый день и топ-100 раз в неделю.
Хороший вопрос, редко разбирают.
На всех площадках или на одной конкретной?
Был случай, когда всё сошлось только на третий день разбора.
Снимайте с одного и того же набора адресов, если сравниваете динамику. Смена пула между съёмами добавляет разброс, который потом принимают за движение позиций.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.