Разделы · Семантика и частотности
Разложил задачу на части и застрял на одной из них.
Вводные, чтобы не гадать.
Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Проверял на выборке в тысячу фраз, там всё гладко. Сбор идёт вторые сутки, а прошло чуть больше половины.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Кто как это обходит?
Разбейте прогон на части, станет ровнее.
Начните с малого объёма и растите постепенно.
Всё верно написали выше, добавлю от себя пару деталей.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
У меня картина совпадает почти полностью.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Это на всех площадках или на одной?
Какая версия программы и что с настройками по умолчанию?