Разделы · Парсеры и сбор данных
Пробовал три варианта, ни один не устроил до конца.
Данные собираются, но при сверке не хватает примерно пятнадцати процентов записей. Проверял на двух версиях программы, поведение одинаковое. Пробовал разбивать список на части по пятьдесят тысяч, стало ровнее.
Может, есть путь проще, которого я не вижу.
На маленьких объёмах верно, на больших уже нет.
Проверка полноты обязательна. Берите случайные сто записей и сверяйте руками с площадкой, это пятнадцать минут и полная ясность.
Сборщик, который умеет продолжить с места обрыва, стоит вдвое дороже по времени разработки и вдесятеро дешевле в работе.
Хороший вопрос, редко разбирают.
Один замер стоит десяти рассуждений.
Считайте по темпу, всё остальное вторично.
Разбейте задачу на части.
Что менялось за последнюю неделю?
Уменьшите потоки вдвое и замерьте заново.
Замерьте и сравните, догадки тут не помогут.
Полгода жил с этим, пока не надоело.
Перед сменой поставщика адресов сделайте контрольный прогон на одинаковой задаче. Иначе разницу в скорости будете объяснять чем угодно, кроме настоящей причины.
$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt обработано: 48 210 / 50 000 пустых ответов: 1 842
Поправлю цифру, остальное верно.
Проверка полноты обязательна. Берите случайные сто записей и сверяйте руками с площадкой, это пятнадцать минут и полная ясность.
Хороший вопрос, редко разбирают.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.