Разделы · Парсеры и сбор данных
Пробовал три варианта, ни один не устроил до конца.
Проверял на двух версиях программы, поведение одинаковое. Прогон рассчитан на восемь часов, встаёт примерно на середине. Данные собираются, но при сверке не хватает примерно пятнадцати процентов записей.
Подскажите, где я ошибаюсь.
Одно уточнение, иначе расчёт уедет.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.
Держите нас в курсе.
Начните с малого объёма и растите постепенно.
Считайте по темпу, всё остальное вторично.
Логи в помощь, без них это гадание.
До этого работало? Что менялось перед тем, как сломалось?
Разбейте прогон на части, станет ровнее.
Смотрите подсети, а не только число адресов.
Пришёл к этому не сразу, сначала сделал ошибку.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Добавлю то, что обычно вылезает на второй месяц работы.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
Держите нас в курсе.