Разделы · Код и программные интерфейсы
Проверял на маленьком объёме, на большом всё поменялось.
На тысяче запросов всё ровно, на ста тысячах начинается расхождение. Состояние прогона храню в файле, чтобы продолжать после обрыва. Логирую код ответа, время и адрес, по которому шёл запрос.
Может, есть более простой путь, которого я не вижу.
Тут есть тонкость, о которой обычно забывают.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
Разбор ответа держите отдельно от сбора. Тогда смена разметки не требует перегонять данные заново, достаточно перечитать сохранённое.
async with aiohttp.ClientSession() as s:
for i in range(3):
try:
r = await s.get(url, proxy=adres, timeout=30)
break
except Exception:
await asyncio.sleep(2 ** i)Логи в помощь, без них это гадание.
Начните с малого объёма и растите постепенно.
Начните с малого объёма и растите постепенно.
Тут ничего нового не скажу, только подтвержу.
Повторы делайте с растущей паузой: первая через две секунды, вторая через четыре, третья через восемь. Три попытки достаточно, дальше проблема не в связи.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.
Был случай, когда всё сошлось только на третий день разбора.
Повторы делайте с растущей паузой: первая через две секунды, вторая через четыре, третья через восемь. Три попытки достаточно, дальше проблема не в связи.
Смотрите подсети, а не только число адресов.