Разделы · Семантика и частотности
Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.
Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Подскажите, где я ошибаюсь.
Был случай, когда всё сошлось только на третий день разбора.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Хороший разбор, добавлю в закладки.
Осторожнее с этим выводом, он верен не всегда.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
У нас на прошлом проекте это выглядело так.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Начните с малого объёма и растите постепенно.
Это на всех площадках или на одной?
Подтверждаю, у нас было ровно то же самое.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Если поможет, напишите здесь же, пригодится следующим.
Проверьте, что настройка вообще применилась.
Начинал с того же, потом переделал.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
У нас на прошлом проекте это выглядело так.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Хороший разбор, добавлю в закладки.
Всё верно написали выше, добавлю от себя пару деталей.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Полгода назад ловил то же самое.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Пришёл к этому не сразу, сначала сделал ошибку.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Если поможет, напишите здесь же, пригодится следующим.