Пишу по горячим следам, вчера потратил на это полдня.
Начну с цифр, они тут важнее слов.
Ядро на 18 тысяч фраз, съём через день. Проверял на двух серверах, разница между ними доходила до трёх пунктов. Держу два набора адресов, один под съём, второй под проверки.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Если у кого есть цифры, покажите.
Подтверждаю, у нас было ровно то же самое.
Регион проверяется просто: снимите одну и ту же выдачу с двух адресов и сравните блок с организациями. Если он одинаковый, регион не подставился.
Съём для магазина на сотни тысяч страниц ведите по выборке. Полный охват тут не нужен: динамику показывает репрезентативная группа запросов.
Уточните пару моментов, иначе гадаем.
Пробовали на другой машине?
Считайте по темпу, всё остальное вторично.
Тут легко перепутать два разных момента.
Считать надо от темпа. Потоки это ваша сторона, площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.
У нас на прошлом проекте это выглядело так.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
По узким регионам берите среднее за несколько замеров. Одна точка там недостоверна. Одиночный съём там даёт слишком большой разброс.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Слежу за темой.
Был похожий случай, разбирали неделю.
Считать надо от темпа. Потоки это ваша сторона, площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Пересъём после апдейта начинайте через сутки. Раньше вы снимаете переходное состояние, и график получается рваным.
Сохранил, пригодится в следующем проекте.
У меня картина совпадает почти полностью.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Первый раз списал на случайность, второй раз уже нет.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
Слежу за темой.
Меняйте по одному, иначе не поймёте причину.
Плюсую, сам пришёл к тому же через полгода проб.
Считать надо от темпа. Потоки это ваша сторона, площадка считает запросы с адреса за минуту. Берёте допустимый темп на адрес, делите на него общий темп прогона, получаете нижнюю границу по адресам.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.