Разделы · Семантика и частотности
Ядро большое, времени мало, хочется понять правильный порядок.
Сбор идёт вторые сутки, а прошло чуть больше половины. Проверял на выборке в тысячу фраз, там всё гладко. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам.
Кто сталкивался, поделитесь опытом.
Считаю так же, и цифры у меня близкие.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Смотрите подсети, а не только число адресов.
Добавлю то, что обычно вылезает на второй месяц работы.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Хороший разбор, добавлю в закладки.
Считаю так же, и цифры у меня близкие.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Начните с малого объёма и растите постепенно.
Тут легко перепутать два разных момента.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Если поможет, напишите здесь же, пригодится следующим.
Добавлю то, что обычно вылезает на второй месяц работы.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Разбейте прогон на части, станет ровнее.
Уменьшите потоки вдвое и замерьте заново.
Проверял на трёх проектах подряд, картина устойчивая.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Подтверждаю, у нас было ровно то же самое.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.