Разделы · Семантика и частотности
Ядро большое, времени мало, хочется понять правильный порядок.
Условия задачи вот такие.
Сбор идёт вторые сутки, а прошло чуть больше половины. Список масок на пять тысяч, глубина расширения три уровня. После сбора из трёх источников дублей вышло около тридцати процентов.
Подскажите, где я ошибаюсь.
Полгода назад ловил то же самое.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Хороший разбор, добавлю в закладки.
Осторожнее с этим выводом, он верен не всегда.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Долго держал старую схему, пока не упёрся.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тут ничего нового не скажу, только подтвержу.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Считайте по темпу, всё остальное вторично.
Проверял на трёх проектах подряд, картина устойчивая.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Держите запас, ровно по расчёту работать не выйдет.
Тут легко перепутать два разных момента.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Одно уточнение, иначе расчёт уедет.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Уточните пару моментов, иначе гадаем.
Это на всех площадках или на одной?
Начинал с того же, потом переделал.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Разбейте прогон на части, станет ровнее.
Проверял это на своей задаче, вывод такой же.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Хороший разбор, добавлю в закладки.
Полгода назад ловил то же самое.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Проверял это на своей задаче, вывод такой же.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204