Работаю с агентством, проектов много, съём ежедневный. Вопрос вот в чём.
Список на 40 тысяч запросов, окно четыре часа, регионов двенадцать. Снимаю 200 проектов ежедневно, в среднем по 600 запросов на проект.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Буду признателен за конкретику.
Проверял на трёх проектах подряд, картина устойчивая.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.
Пришёл к этому не сразу, сначала сделал ошибку.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Пул под такие объёмы держу постоянный. Беру адреса с безлимитным трафиком, потому что там разброс по подсетям нормальный, а это на съёме важнее скорости.
Начните с малого объёма и растите постепенно.
Согласен с предыдущим ответом, но с одной оговоркой.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
Проверял на трёх проектах подряд, картина устойчивая.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Если поможет, напишите здесь же, пригодится следующим.
Осторожнее с этим выводом, он верен не всегда.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Считайте по темпу, всё остальное вторично.
До этого работало? Что менялось перед тем, как сломалось?
Проверял это на своей задаче, вывод такой же.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Держите нас в курсе.
Уточните пару моментов, иначе гадаем.