Разделы · Индексация и техаудит
Работаю с каталогом на сотни тысяч страниц, вопрос по обходу.
Вводные, чтобы не гадать.
Карта сайта разбита на файлы по пятьдесят тысяч адресов. После переезда на другой хостинг скорость обхода упала примерно вдвое. Логи за месяц весят около двенадцати гигабайт, разбираю их частями.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Буду признателен за конкретику.
Тут есть тонкость, о которой обычно забывают.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
Держите нас в курсе.
Осторожнее с этим выводом, он верен не всегда.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Держите запас, ровно по расчёту работать не выйдет.
Осторожнее с этим выводом, он верен не всегда.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Отпишитесь, чем закончится, тема полезная.
Осторожнее с этим выводом, он верен не всегда.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Долго держал старую схему, пока не упёрся.
Обход большого сайта надо ограничивать по темпу, а не по потокам. Хороший ориентир: не больше десяти запросов в секунду ко всему сайту, если это не ваш сервер.
Логи сервера и панель вебмастера считают разное. Логи показывают все обращения, панель показывает то, что робот счёл достойным упоминания. Расхождение в пять или десять процентов это нормально.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Подтверждаю, у нас было ровно то же самое.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
Уточните пару моментов, иначе гадаем.
Сколько адресов и какой темп при этом стоит?
Тут есть тонкость, о которой обычно забывают.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Проверял это на своей задаче, вывод такой же.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
Начните с малого объёма и растите постепенно.