Разделы · Индексация и техаудит
Начал разбираться и нашёл больше вопросов, чем ответов.
По порядку.
Часть разделов робот обходит раз в две недели, часть каждый день. Сайт на 180 тысяч страниц, обновляется ежедневно. Проверка идёт с 30 адресов, темп примерно шесть запросов в минуту на адрес.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Хочется услышать, чем это заканчивается на практике.
Одно уточнение, иначе расчёт уедет.
Обход с параметрами ограничивайте правилом на своей стороне: список разрешённых параметров работает лучше списка запрещённых.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
Забрал себе в заметки.
Добавлю то, что обычно выясняется поздно.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Проверьте на второй машине, это отсекает половину версий.
Осторожнее с обобщением, случаи бывают разные.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
Обход с параметрами ограничивайте правилом на своей стороне: список разрешённых параметров работает лучше списка запрещённых.
Отпишитесь, чем закончится, тема полезная.
Схема рабочая, но у неё есть предел.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
До сих пор помню, чем это закончилось.
Обход большого сайта ограничивайте по темпу. Ограничение по потокам тут почти бесполезно. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Тут ничего нового не скажу, только подтвержу.
Проверку по расписанию разносите: не запускайте всё в полночь, размажьте по суткам.
На другой машине воспроизводится?
Пробовали на другой машине?
Почти так, но одна деталь меняет вывод.
Логи разбирайте по дням. Целиком их открывать незачем. Месячный файл на десяток гигабайт открывать целиком незачем.
Согласен целиком, добавлю только цифру.
Проверку по расписанию разносите: не запускайте всё в полночь, размажьте по суткам.
Ставьте таймаут, иначе висит вечно.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.