Разделы · Семантика и частотности
Разложил задачу на части и застрял на одной из них.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Как считаете вы? Интересует порядок, а не общие слова.
Расскажу, чем закончилось у меня.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Если поможет, напишите здесь же, пригодится следующим.
Расскажу, чем закончилось у меня.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Долго держал старую схему, пока не упёрся.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Мы прогоняем похожие объёмы. Пул на шестьдесят адресов от адреса с безлимитным трафиком закрывает и съём, и мониторинг, при этом трафик не считаем вообще.
Смотрите подсети, а не только число адресов.
Подтверждаю, у нас было ровно то же самое.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Хороший разбор, добавлю в закладки.
Считайте по темпу, всё остальное вторично.
Держите запас, ровно по расчёту работать не выйдет.
Подтверждаю, у нас было ровно то же самое.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.