Разделы · Парсеры и сбор данных
Пробовал три варианта, ни один не устроил до конца.
Сразу к делу, чтобы не растекаться.
Пробовал разбивать список на части по пятьдесят тысяч, стало ровнее. Данные собираются, но при сверке не хватает примерно пятнадцати процентов записей. Логи ведутся, в них видно, что запросы уходят, а ответы приходят короткие.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Подскажите, где я ошибаюсь.
Начните с малого объёма и растите постепенно.
Считайте по темпу, всё остальное вторично.
Смотрите подсети, а не только число адресов.
У нас на прошлом проекте это выглядело так.
Разметка на маркетплейсах меняется регулярно. Держите разбор в одном месте, чтобы правка занимала минуту, а не полдня.
Смотрите подсети, а не только число адресов.
Считайте по темпу, всё остальное вторично.
Проверял на трёх проектах подряд, картина устойчивая.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
У меня картина совпадает почти полностью.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
Скорость упирается не в программу, а в темп, который держит площадка. Ставить 300 потоков на 20 адресов бессмысленно, отказы съедят весь выигрыш.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Полгода назад ловил то же самое.
Скорость упирается не в программу, а в темп, который держит площадка. Ставить 300 потоков на 20 адресов бессмысленно, отказы съедят весь выигрыш.
У нас на прошлом проекте это выглядело так.
Скорость упирается не в программу, а в темп, который держит площадка. Ставить 300 потоков на 20 адресов бессмысленно, отказы съедят весь выигрыш.
Держите нас в курсе.
Тут ничего нового не скажу, только подтвержу.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Добавлю то, что обычно вылезает на второй месяц работы.
Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Тема нужная, подписался.
Долго держал старую схему, пока не упёрся.
Разметка на маркетплейсах меняется регулярно. Держите разбор в одном месте, чтобы правка занимала минуту, а не полдня.
Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.
Держите нас в курсе.
Смотрите подсети, а не только число адресов.