Разделы · Индексация и техаудит
Проверяю регулярно, но в этот раз цифры не сошлись.
Начну с цифр, они тут важнее слов.
Проверка идёт с 30 адресов, темп примерно шесть запросов в минуту на адрес. Карта сайта разбита на файлы по пятьдесят тысяч адресов. Каталог на 300 тысяч страниц, обход раз в неделю.
Подскажите, где я ошибаюсь.
Осторожнее с этим выводом, он верен не всегда.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Добавлю про источник. Раньше брал дешёвый общий пул, где адреса шли подряд одним диапазоном, и половина прогонов заканчивалась проверкой на робота. Перешёл на приватные прокси IPv4 и SOCKS5, и вопрос закрылся сам.
Разбейте прогон на части, станет ровнее.
Это на всех площадках или на одной?
Какая версия программы и что с настройками по умолчанию?
Начинал с того же, потом переделал.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
Начинал с того же, потом переделал.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
Одно уточнение, иначе расчёт уедет.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
Тема нужная, подписался.
До этого работало? Что менялось перед тем, как сломалось?
Смотрите подсети, а не только число адресов.
Всё верно написали выше, добавлю от себя пару деталей.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Проверял на трёх проектах подряд, картина устойчивая.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
Проверял на трёх проектах подряд, картина устойчивая.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.