Разделы · Семантика и частотности
Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.
Что имеем на входе.
Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Проверял на выборке в тысячу фраз, там всё гладко.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Как считаете вы? Интересует порядок, а не общие слова.
Пришёл к этому не сразу, сначала сделал ошибку.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Расскажу, чем закончилось у меня.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Начните с малого объёма и растите постепенно.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Разбейте прогон на части, станет ровнее.
Пришёл к этому не сразу, сначала сделал ошибку.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Тема нужная, подписался.
Подтверждаю, у нас было ровно то же самое.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Согласен с предыдущим ответом, но с одной оговоркой.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Хороший разбор, добавлю в закладки.
Тут есть тонкость, о которой обычно забывают.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Проверял это на своей задаче, вывод такой же.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Согласен с предыдущим ответом, но с одной оговоркой.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Полгода назад ловил то же самое.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Осторожнее с этим выводом, он верен не всегда.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Держите нас в курсе.
Это на всех площадках или на одной?
Всё верно написали выше, добавлю от себя пару деталей.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Поправлю: дело не в объёме, а в темпе.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Хороший разбор, добавлю в закладки.