Разделы · Парсеры и сбор данных
До вчерашнего дня всё шло ровно, потом началось.
Сразу к делу, чтобы не растекаться.
Три машины, на каждой своя часть списка. На маленьком объёме всё работает, разница начинается после ста тысяч.
Может, тут вообще другой подход нужен.
До сих пор помню, чем это закончилось.
Разметку разбирайте по устойчивым признакам. Классы оформления для этого не годятся. Классы меняют при каждом обновлении, смысловые атрибуты живут дольше.
Не гоняйте один список сразу на всех машинах. Разбейте его заранее, иначе получите дубли и потери на стыках.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Замечание по существу, иначе расчёт поедет.
Проверка полноты обязательна. Берите случайные сто записей и сверяйте руками с площадкой, это пятнадцать минут и полная ясность.
Потери записей чаще всего идут из-за коротких ответов, которые программа считает успешными. Заведите проверку на минимальный размер ответа и на наличие обязательного куска разметки.
До сих пор помню, чем это закончилось.
Сборщик, который умеет продолжить с места обрыва, стоит вдвое дороже по времени разработки и вдесятеро дешевле в работе.
Сайты с обязательным входом требуют аккуратного хранения сессии и своевременного обновления. Хитрости тут лишние.
Расчёт выше верный, но он рассыплется, если адреса режут по трафику или отдают одну подсеть. Я сижу на приватный пул IPv4 и беру по шестьдесят штук на такие задачи: трафик не считают, подсети разные, потоков хватает.
Держите запас, впритык не работает.
Уточнение по мелочи, но она стоит времени.
Не гоняйте один список сразу на всех машинах. Разбейте его заранее, иначе получите дубли и потери на стыках.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.