Ниже разбор случая, который мне стоил двух вечеров.
Сразу к делу, чтобы не растекаться.
Ночной прогон занимает около шести часов, утром данные должны лежать в таблице. Проверял на двух серверах, разница между ними доходила до трёх пунктов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Как считаете вы? Интересует порядок, а не общие слова.
Проверял это на своей задаче, вывод такой же.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Тема нужная, подписался.
Какая версия программы и что с настройками по умолчанию?
Согласен с предыдущим ответом, но с одной оговоркой.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Пришёл к этому не сразу, сначала сделал ошибку.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Расскажу, чем закончилось у меня.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Отпишитесь, чем закончится, тема полезная.
Полгода назад ловил то же самое.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
Если поможет, напишите здесь же, пригодится следующим.
Держите запас, ровно по расчёту работать не выйдет.
Тут ничего нового не скажу, только подтвержу.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Держите нас в курсе.
Поправлю: дело не в объёме, а в темпе.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Тема нужная, подписался.
Тут есть тонкость, о которой обычно забывают.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.