Разделы · Код и программные интерфейсы
Спрашиваю совета, потому что вариантов вижу три и все с изъяном.
Состояние прогона храню в файле, чтобы продолжать после обрыва. На тысяче запросов всё ровно, на ста тысячах начинается расхождение. Питон, асинхронный сбор, одновременно держу около двухсот задач.
async with aiohttp.ClientSession() as s:
for i in range(3):
try:
r = await s.get(url, proxy=adres, timeout=30)
break
except Exception:
await asyncio.sleep(2 ** i)
Подскажите, где я ошибаюсь.
Логи в помощь, без них это гадание.
Полгода назад ловил то же самое.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.
Сессия должна создаваться один раз и жить весь прогон. Новая сессия на каждый запрос съедает время на установку соединения и путает настройки.
async with aiohttp.ClientSession() as s:
for i in range(3):
try:
r = await s.get(url, proxy=adres, timeout=30)
break
except Exception:
await asyncio.sleep(2 ** i)Почти так, но одна деталь меняет вывод.
Логируйте код ответа, время и адрес. Три поля, и почти любой разбор потом занимает минуты.
Сессия должна создаваться один раз и жить весь прогон. Новая сессия на каждый запрос съедает время на установку соединения и путает настройки.
У нас на прошлом проекте это выглядело так.
Сессия должна создаваться один раз и жить весь прогон. Новая сессия на каждый запрос съедает время на установку соединения и путает настройки.
Уменьшите потоки вдвое и замерьте заново.
Осторожнее с этим выводом, он верен не всегда.
Логируйте код ответа, время и адрес. Три поля, и почти любой разбор потом занимает минуты.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.
Расскажу, чем закончилось у меня.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
Число одновременных задач подбирайте замером, а не на глаз. Обычно кривая выходит на полку, и дальше растёт только число отказов.
Согласен с предыдущим ответом, но с одной оговоркой.
Разбор ответа держите отдельно от сбора. Тогда смена разметки не требует перегонять данные заново, достаточно перечитать сохранённое.
Повторы делайте с растущей паузой: первая через две секунды, вторая через четыре, третья через восемь. Три попытки достаточно, дальше проблема не в связи.
Отпишитесь, чем закончится, тема полезная.
На другой машине воспроизводится?
На другой машине воспроизводится?
Был случай, когда всё сошлось только на третий день разбора.
Число одновременных задач подбирайте замером, а не на глаз. Обычно кривая выходит на полку, и дальше растёт только число отказов.
Состояние прогона храните построчно, а не одним куском в конце. Тогда обрыв на девяностом проценте не стоит вам всего прогона.
Осторожнее с этим выводом, он верен не всегда.
Адрес выбирайте по кругу с пропуском тех, что в отказе. Случайный выбор даёт перекос, кому-то достанется втрое больше запросов.
Логируйте код ответа, время и адрес. Три поля, и почти любой разбор потом занимает минуты.
async with aiohttp.ClientSession() as s:
for i in range(3):
try:
r = await s.get(url, proxy=adres, timeout=30)
break
except Exception:
await asyncio.sleep(2 ** i)Какая версия программы и что с настройками по умолчанию?
Согласен с предыдущим ответом, но с одной оговоркой.
Повторы делайте с растущей паузой: первая через две секунды, вторая через четыре, третья через восемь. Три попытки достаточно, дальше проблема не в связи.
Уточните пару моментов, иначе гадаем.
Какая версия программы и что с настройками по умолчанию?