Работаю с агентством, проектов много, съём ежедневный. Вопрос вот в чём.
Обстановка простая, а ответа не нахожу.
Список на 40 тысяч запросов, окно четыре часа, регионов двенадцать. Ночной прогон занимает около шести часов, утром данные должны лежать в таблице. Снимаю 200 проектов ежедневно, в среднем по 600 запросов на проект.
Подскажите направление, дальше сам.
Так и есть, проходил через это в прошлом году.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
Забрал себе в заметки.
Всё правильно расписано, повторю своими словами.
Пересъём после апдейта начинайте через сутки. Раньше вы снимаете переходное состояние, и график получается рваным.
Половина верна, вторую половину поправлю.
Снимайте с одного и того же набора адресов, если сравниваете динамику. Смена пула между съёмами добавляет разброс, который потом принимают за движение позиций.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Верно по сути, дальше нюансы.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Разбор годный, спорить не буду.
Не гоните с первого дня, дайте себе запас.
Разбейте прогон на части, станет ровнее.
Мы держали старую схему год, зря.
Историю позиций храните с отметкой, каким набором адресов и в какое время снято. Без этого спорить о расхождениях невозможно.
Глубину и частоту подбирайте под задачу. Ежедневный топ-100 по всему ядру это расход ради расхода, обычно хватает топ-20 каждый день и топ-100 раз в неделю.
Тема нужная, подписался.
На всех площадках или на одной конкретной?
Уточните пару моментов, иначе гадаем.
Так и делаю, работает без сюрпризов.
Историю позиций храните с отметкой, каким набором адресов и в какое время снято. Без этого спорить о расхождениях невозможно.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
Одно уточнение, иначе расчёт уедет.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Полгода назад ловил то же самое.
Глубину топ-100 берите только там, где она нужна. Топ-20 собирается втрое быстрее и закрывает большинство отчётов.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Это верно для одной площадки и неверно для другой.
На 40 тысячах запросов за четыре часа общий темп около 167 запросов в минуту. При восьми запросах в минуту на адрес нужен 21 адрес, и это без запаса. Запас закладываю двойной, потому что часть адресов отваливается на ровном ходу.
Замечание по существу, иначе расчёт поедет.
Держите время съёма постоянным. Прогон в семь утра и прогон в час дня дают разные картины, а разговор с заказчиком идёт про динамику.
curl -s -x socks5://user:pass@10.0.0.5:1080 \ "https://example.org/search?text=запрос&lr=213" | head -c 300
Тут есть тонкость, о которой обычно забывают.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
Тут есть тонкость, о которой обычно забывают.
Персонализация выдачи работает и без входа в аккаунт: учитывается регион, устройство и прошлые заходы с адреса. Свежий адрес даёт более чистую картину.
Расхождение между сервисами объясняется устройством выборки: кто-то берёт первую страницу, кто-то склеивает несколько, кто-то чистит рекламные блоки. Сравнивать их напрямую бессмысленно.
Тут не всё так однозначно, смотря какой объём.
Ночной прогон удобен тем, что данные лежат в таблице к началу рабочего дня. Тишина на площадке тут ни при чём. Это единственная его настоящая польза.
Позиции по коммерческим запросам живут своей жизнью в течение дня. Если снимать утром и вечером, разница в десять пунктов норма, и это не сбой.
Слежу за темой.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.