Разделы · Индексация и техаудит
Спрашиваю у тех, кто гоняет обходы регулярно.
Логи за месяц весят около двенадцати гигабайт, разбираю их частями. Карта сайта разбита на файлы по пятьдесят тысяч адресов.
Подскажите, где я ошибаюсь.
Проверял на трёх проектах подряд, картина устойчивая.
Параметры в адресах плодят бесконечные варианты. Закройте их правилом обхода на своей стороне, иначе краулер будет ходить кругами.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Отпишитесь, чем закончится, тема полезная.
Проверял на трёх проектах подряд, картина устойчивая.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Начните с малого объёма и растите постепенно.
Тут легко перепутать два разных момента.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
Полный обход раз в неделю плюс выборочный по важным разделам каждый день закрывает большинство задач и не грузит сервер.
Был случай, когда всё сошлось только на третий день разбора.
Если страницы отдают код 200 и не попадают в индекс, смотрите на дубли и на качество содержимого. Технически они доступны, а смысла в них поиск не увидел.
Карту сайта на два миллиона адресов делите на файлы по пятьдесят тысяч и собирайте в общий указатель. Так проще и роботу, и вам при разборе.
$ ./obhod --start https://example.org/ --rps 8 --out kody.csv 200 -> 284 110 301 -> 12 448 404 -> 1 902
Отпишитесь, чем закончится, тема полезная.