Разделы · Семантика и частотности
Второй раз наступаю на одни грабли, решил спросить.
Обстановка простая, а ответа не нахожу.
Сбор идёт вторые сутки, а прошло чуть больше половины. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Как считаете вы? Интересует порядок, а не общие слова.
Начинал с того же, потом переделал.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Считаю так же, и цифры у меня близкие.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Смотрите подсети, а не только число адресов.
А что показывают логи в момент падения?
Какая версия программы и что с настройками по умолчанию?
Всё верно написали выше, добавлю от себя пару деталей.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Полгода назад ловил то же самое.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Держите нас в курсе.
Осторожнее с этим выводом, он верен не всегда.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Почти так, но одна деталь меняет вывод.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Тема нужная, подписался.
Поправлю: дело не в объёме, а в темпе.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Держите запас, ровно по расчёту работать не выйдет.
До этого работало? Что менялось перед тем, как сломалось?
Согласен с предыдущим ответом, но с одной оговоркой.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Расскажу, чем закончилось у меня.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Поправлю: дело не в объёме, а в темпе.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.