Пишу по горячим следам, вчера потратил на это полдня.
Коротко об условиях.
Сравнивал с панелью вебмастера за тот же день, расхождение стабильное. Ночной прогон занимает около шести часов, утром данные должны лежать в таблице. Проверял на двух серверах, разница между ними доходила до трёх пунктов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Кто как это обходит?
На такой задаче адреса надо держать свои, а не общие. Общий пул делится с незнакомыми людьми, и лимит вы никогда не контролируете. Я беру приватный пул IPv4 и сплю спокойно.
Работает, пока объём небольшой. Дальше правила другие.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Был случай, когда всё сошлось только на третий день разбора.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Отпишитесь, чем закончится, тема полезная.
Полгода назад ловил то же самое.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Добавлю то, что обычно вылезает на второй месяц работы.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.
Долго держал старую схему, пока не упёрся.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Считать надо от темпа, а не от числа потоков. Потоки это ваша сторона, а площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Долго держал старую схему, пока не упёрся.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Поправлю: дело не в объёме, а в темпе.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Держите нас в курсе.
Какая версия программы и что с настройками по умолчанию?
Расскажу, чем закончилось у меня.
Расхождение с панелью вебмастера почти всегда объясняется тремя вещами: разное время съёма, разная привязка к региону и разное устройство выборки. Панель усредняет за сутки, вы снимаете точку.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300