Ниже разбор случая, который мне стоил двух вечеров.
Держу два набора адресов, один под съём, второй под проверки. Держу 60 адресов, потоков ставлю 120, глубина топ-50.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Правильно ли я вообще ставлю вопрос?
Замечание по существу, иначе расчёт поедет.
Историю позиций храните с отметкой, каким набором адресов и в какое время снято. Без этого спорить о расхождениях невозможно.
Считать надо от темпа. Потоки это ваша сторона, площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Верно, и это не единичный случай.
Пересъём после апдейта начинайте через сутки. Раньше вы снимаете переходное состояние, и график получается рваным.
Если данные утром оказались пустыми, смотрите запись результата. Сам прогон обычно проходит нормально. Чаще всего сбор прошёл, а сохранение упало на последнем шаге.
Осторожнее с обобщением, случаи бывают разные.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Это следствие, а причина лежит глубже.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Пересъём после апдейта начинайте через сутки. Раньше вы снимаете переходное состояние, и график получается рваным.
Написано верно, добавить почти нечего.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Персонализация выдачи работает и без входа в аккаунт: учитывается регион, устройство и прошлые заходы с адреса. Свежий адрес даёт более чистую картину.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Был случай, когда всё сошлось только на третий день разбора.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
Съём для магазина на сотни тысяч страниц ведите по выборке. Полный охват тут не нужен: динамику показывает репрезентативная группа запросов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Хороший разбор, добавлю в закладки.
Начните с малого объёма и растите постепенно.
Так и работает, проверено не один раз.
Глубину и частоту подбирайте под задачу. Ежедневный топ-100 по всему ядру это расход ради расхода, обычно хватает топ-20 каждый день и топ-100 раз в неделю.
Пересъём после апдейта начинайте через сутки. Раньше вы снимаете переходное состояние, и график получается рваным.
Добавлю тему в закладки.
До этого работало? Что менялось перед тем, как сломалось?
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.