Разделы · Код и программные интерфейсы
Ниже кусок кода и описание того, что получается.
Сначала обстановка, вопрос в конце.
Состояние прогона храню в файле, чтобы продолжать после обрыва. Результаты пишу пачками по тысяче строк. Логирую код ответа, время и адрес, по которому шёл запрос.
Как считаете вы? Интересует порядок, а не общие слова.
Полгода назад ловил то же самое.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
async with aiohttp.ClientSession() as s:
for i in range(3):
try:
r = await s.get(url, proxy=adres, timeout=30)
break
except Exception:
await asyncio.sleep(2 ** i)
Отпишитесь, чем закончится, тема полезная.
Был случай, когда всё сошлось только на третий день разбора.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
Разбор ответа держите отдельно от сбора. Тогда смена разметки не требует перегонять данные заново, достаточно перечитать сохранённое.
Тут ничего нового не скажу, только подтвержу.
Повторы делайте с растущей паузой: первая через две секунды, вторая через четыре, третья через восемь. Три попытки достаточно, дальше проблема не в связи.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.
Тут ничего нового не скажу, только подтвержу.
Число одновременных задач подбирайте замером, а не на глаз. Обычно кривая выходит на полку, и дальше растёт только число отказов.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
Отпишитесь, чем закончится, тема полезная.
Осторожнее с этим выводом, он верен не всегда.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.