позиции · сбор данных · отчёты
реклама IPrazon Network: приватные прокси IPv4 и SOCKS5, пул 12 000 адресов, безлимитный трафик, бесплатный тест до 2 часов

Разделы · Парсеры и сбор данных

Как настроить парсинг яндекс карт в datacol без потери данных

9 ответов · 3 799 просмотров
знак участника proxyled
proxyledЗнаток
  • сообщений 1 620
  • на форуме 6 мес
Парсеры и сбор данныхгорячая

Проверил очевидное, осталось непонятное.

Детали такие.

Ставил 200 потоков, потом снижал до 80, разница по времени невелика. Данные собираются, но при сверке не хватает примерно пятнадцати процентов записей. Три машины, на каждой своя часть списка.

Буду признателен за конкретику.

держу два поставщика, чтобы спать
знак участника Светлана Бор
Светлана БорНовичок
  • сообщений 205
  • на форуме 1 года
proxyled писал: Как настроить парсинг яндекс карт в datacol …

Один момент упущен, и он важный.

Если данные отдаются скриптом, обычный сбор их не увидит. Смотрите, откуда страница берёт содержимое: часто рядом есть простой запрос, который отдаёт то же самое в удобном виде.

$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt
обработано: 48 210 / 50 000
пустых ответов: 1 842

Сохранил, пригодится в следующем проекте.

знак участника prosmotr_logov
prosmotr_logovВетеран
  • сообщений 3 040
  • на форуме 1 мес

Ловил это дважды, оба раза по разным причинам.

Память ест хранение всего собранного до конца прогона, число потоков тут ни при чём. Пишите результат на диск пачками, и потолок пропадёт.

$ ./sbor --potokov 120 --spisok chast-01.txt --proksi pool.txt
обработано: 48 210 / 50 000
пустых ответов: 1 842
знак участника Останин
ОстанинУчастник
  • сообщений 1 105
  • на форуме 6 мес

Это следствие, а причина лежит глубже.

Не гоняйте один список сразу на всех машинах. Разбейте его заранее, иначе получите дубли и потери на стыках.

Разметка на маркетплейсах меняется регулярно. Держите разбор в одном месте, чтобы правка занимала минуту вместо полдня.

знак участника Астахов
АстаховУчастник
  • сообщений 1 150
  • на форуме 6 мес

Поправлю цифру, остальное верно.

Большие каталоги не надо гонять одним куском. Разбейте на части по пятьдесят тысяч, каждую с отдельным состоянием, и падение одной части перестанет ронять весь прогон.

Перед большим прогоном всегда гоняю пробу на тысяче адресов. Три минуты времени, и сразу видно, где посыплется.

знак участника sbor_i_svod
sbor_i_svodЗнаток
  • сообщений 1 520
  • на форуме 5 мес

Наступал на это в прошлом сезоне.

Память ест хранение всего собранного до конца прогона, число потоков тут ни при чём. Пишите результат на диск пачками, и потолок пропадёт.

Разбор годный, спорить не буду.

знак участника Ким Р.
Ким Р.Новичок
  • сообщений 214
  • на форуме 1 года

Пробовали снизить темп вдвое?

Это началось после какого-то изменения?

знак участника Данилов К.
Данилов К.Участник
  • сообщений 1 245
  • на форуме 8 мес
proxyled писал: Как настроить парсинг яндекс карт в datacol …

Держите запас, впритык не работает.

знак участника retry_backoff
retry_backoffЗнаток
  • сообщений 2 710
  • на форуме 2 мес

Сколько адресов и какой темп при этом стоит?

знак участника Барсов
БарсовУчастник
  • сообщений 1 420
  • на форуме 8 мес

Помню, как искал причину два дня подряд.

Разметку разбирайте по устойчивым признакам. Классы оформления для этого не годятся. Классы меняют при каждом обновлении, смысловые атрибуты живут дольше.

Сборщик, который умеет продолжить с места обрыва, стоит вдвое дороже по времени разработки и вдесятеро дешевле в работе.

Ответить в темеПодписаться

Рядом в разделе

Сеометр, форум специалистов по поиску и аналитике ПравилаУчастникиО форумеЛента 2026