Разделы · Семантика и частотности
Прошу совета у тех, кто собирает регулярно и много.
Опишу по порядку, что есть и чего не хватает.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Проверял на выборке в тысячу фраз, там всё гладко.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Кто как это обходит?
Уменьшите потоки вдвое и замерьте заново.
Какая версия программы и что с настройками по умолчанию?
Мы прогоняем похожие объёмы. Пул на шестьдесят адресов от серверные адреса IPv4 закрывает и съём, и мониторинг, при этом трафик не считаем вообще.
У нас на прошлом проекте это выглядело так.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
На другой машине воспроизводится?
До этого работало? Что менялось перед тем, как сломалось?
Почти так, но одна деталь меняет вывод.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Тема нужная, подписался.
Уточните пару моментов, иначе гадаем.
Сколько адресов и какой темп при этом стоит?
Поправлю: дело не в объёме, а в темпе.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
А что показывают логи в момент падения?
Уменьшите потоки вдвое и замерьте заново.
Разбейте прогон на части, станет ровнее.
Начинал с того же, потом переделал.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
У нас на прошлом проекте это выглядело так.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Поправлю: дело не в объёме, а в темпе.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Держите нас в курсе.
Тут ничего нового не скажу, только подтвержу.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.