Разделы · Парсеры и сбор данных
Прогон большой, машина не слабая, а результат странный.
Прогон рассчитан на восемь часов, встаёт примерно на середине. Ставил 200 потоков, потом снижал до 80, разница по времени невелика. Пробовал разбивать список на части по пятьдесят тысяч, стало ровнее.
Как считаете вы? Интересует порядок, а не общие слова.
Полгода назад ловил то же самое.
Скорость упирается не в программу, а в темп, который держит площадка. Ставить 300 потоков на 20 адресов бессмысленно, отказы съедят весь выигрыш.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру серверные адреса IPv4 как раз поэтому.
Разбейте прогон на части, станет ровнее.
До этого работало? Что менялось перед тем, как сломалось?
Одно уточнение, иначе расчёт уедет.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
Тема нужная, подписался.
Проверял это на своей задаче, вывод такой же.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Подтверждаю, у нас было ровно то же самое.
Скорость упирается не в программу, а в темп, который держит площадка. Ставить 300 потоков на 20 адресов бессмысленно, отказы съедят весь выигрыш.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Подтверждаю, у нас было ровно то же самое.
Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.
Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.
Хороший разбор, добавлю в закладки.
Проверял на трёх проектах подряд, картина устойчивая.
Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Полгода назад ловил то же самое.
Память ест не число потоков, а хранение всего собранного в памяти до конца прогона. Пишите результат на диск пачками, и потолок пропадёт.
Держите нас в курсе.