Разделы · Семантика и частотности
Второй раз наступаю на одни грабли, решил спросить.
Ниже вводные, дальше сам вопрос.
Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Как считаете вы? Интересует порядок, а не общие слова.
У нас на прошлом проекте это выглядело так.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Логи в помощь, без них это гадание.
Сколько адресов и какой темп при этом стоит?
Уточните пару моментов, иначе гадаем.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Держите запас, ровно по расчёту работать не выйдет.
Одно уточнение, иначе расчёт уедет.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Держите нас в курсе.
Считаю так же, и цифры у меня близкие.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Почти так, но одна деталь меняет вывод.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Проверял на трёх проектах подряд, картина устойчивая.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Хороший разбор, добавлю в закладки.
До этого работало? Что менялось перед тем, как сломалось?
Это на всех площадках или на одной?
Подтверждаю, у нас было ровно то же самое.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Уточните пару моментов, иначе гадаем.
Уточните пару моментов, иначе гадаем.
Какая версия программы и что с настройками по умолчанию?