Разделы · Семантика и частотности
Ядро большое, времени мало, хочется понять правильный порядок.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. Сбор идёт вторые сутки, а прошло чуть больше половины. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Может, есть более простой путь, которого я не вижу.
Долго держал старую схему, пока не упёрся.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Подтверждаю, у нас было ровно то же самое.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
А что показывают логи в момент падения?
Так и есть, проходил через это в прошлом году.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тема нужная, подписался.
Тут легко перепутать два разных момента.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
У меня картина совпадает почти полностью.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Хороший разбор, добавлю в закладки.
Был случай, когда всё сошлось только на третий день разбора.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Сколько адресов и какой темп при этом стоит?
До этого работало? Что менялось перед тем, как сломалось?
Уменьшите потоки вдвое и замерьте заново.