Разделы · Индексация и техаудит
Работаю с каталогом на сотни тысяч страниц, вопрос по обходу.
Вводные, чтобы не гадать.
Карта сайта разбита на файлы по пятьдесят тысяч адресов. Каталог на 300 тысяч страниц, обход раз в неделю.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Хочется услышать цифры от практиков.
Держите запас, ровно по расчёту работать не выйдет.
Одно уточнение, иначе расчёт уедет.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Полгода назад ловил то же самое.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
У меня картина совпадает почти полностью.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Тема нужная, подписался.
Проверьте, что настройка вообще применилась.
Начните с малого объёма и растите постепенно.
Пришёл к этому не сразу, сначала сделал ошибку.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
Так и есть, проходил через это в прошлом году.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
Осторожнее с этим выводом, он верен не всегда.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Согласен с предыдущим ответом, но с одной оговоркой.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Так и есть, проходил через это в прошлом году.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
Тема нужная, подписался.
Держите запас, ровно по расчёту работать не выйдет.