Разделы · Семантика и частотности
Расскажу, что делаю сейчас, и спрошу, где ошибаюсь.
Вводные, чтобы не гадать.
Сбор идёт вторые сутки, а прошло чуть больше половины. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Хочется услышать цифры от практиков.
Так и есть, проходил через это в прошлом году.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Уменьшите потоки вдвое и замерьте заново.
Так и есть, проходил через это в прошлом году.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Если поможет, напишите здесь же, пригодится следующим.
Расскажу, чем закончилось у меня.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Был случай, когда всё сошлось только на третий день разбора.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Одно уточнение, иначе расчёт уедет.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Почти так, но одна деталь меняет вывод.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.