Разделы · Семантика и частотности
Прошу совета у тех, кто собирает регулярно и много.
Что имеем на входе.
Сбор идёт вторые сутки, а прошло чуть больше половины. Список масок на пять тысяч, глубина расширения три уровня. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
Хочется услышать цифры от практиков.
Считайте по темпу, всё остальное вторично.
У меня картина совпадает почти полностью.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Согласен с предыдущим ответом, но с одной оговоркой.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Считайте по темпу, всё остальное вторично.
Почти так, но одна деталь меняет вывод.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Отпишитесь, чем закончится, тема полезная.
Разбейте прогон на части, станет ровнее.
Расскажу, чем закончилось у меня.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Держите нас в курсе.
Смотрите подсети, а не только число адресов.
Начинал с того же, потом переделал.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Был случай, когда всё сошлось только на третий день разбора.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тут есть тонкость, о которой обычно забывают.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Почти так, но одна деталь меняет вывод.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.