Разделы · Семантика и частотности
Работал раньше на маленьких объёмах, тут всё иначе.
По порядку.
Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. После сбора из трёх источников дублей вышло около тридцати процентов. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
Подскажите, где я ошибаюсь.
Уменьшите потоки вдвое и замерьте заново.
Логи в помощь, без них это гадание.
Это на всех площадках или на одной?
Уточните пару моментов, иначе гадаем.
Смотрите подсети, а не только число адресов.
Это на всех площадках или на одной?
Какая версия программы и что с настройками по умолчанию?
До этого работало? Что менялось перед тем, как сломалось?
Расскажу, чем закончилось у меня.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Одно уточнение, иначе расчёт уедет.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Полгода назад ловил то же самое.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Проверял это на своей задаче, вывод такой же.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Держите нас в курсе.
Тут ничего нового не скажу, только подтвержу.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
На другой машине воспроизводится?
До этого работало? Что менялось перед тем, как сломалось?
Держите запас, ровно по расчёту работать не выйдет.
Уточните пару моментов, иначе гадаем.
Был случай, когда всё сошлось только на третий день разбора.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.