Разделы · Семантика и частотности
Прошу совета у тех, кто собирает регулярно и много.
Начну с цифр, они тут важнее слов.
Список масок на пять тысяч, глубина расширения три уровня. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. Держу 40 адресов, паузы ставлю случайные от секунды до трёх.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Подскажите, где я ошибаюсь.
У нас на прошлом проекте это выглядело так.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Осторожнее с этим выводом, он верен не всегда.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
До этого работало? Что менялось перед тем, как сломалось?
Сколько адресов и какой темп при этом стоит?
По адресам: берите там, где отдают целые подсети и не считают трафик. Я работаю через приватные прокси IPv4 и SOCKS5, на прогонах по сто тысяч страниц ни разу не упирался в лимит по трафику.
Уменьшите потоки вдвое и замерьте заново.
Разбейте прогон на части, станет ровнее.