Разделы · Семантика и частотности
Прошу совета у тех, кто собирает регулярно и много.
Мусора после первого прохода около сорока процентов. После сбора из трёх источников дублей вышло около тридцати процентов. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Правильно ли я вообще ставлю вопрос?
Первый раз списал на случайность, второй раз уже нет.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Тут ничего нового не скажу, только подтвержу.
Пустые ответы при живых адресах почти всегда означают, что площадка отдаёт заглушку. Проверяйте размер ответа.
Какая версия программы и что с настройками по умолчанию?
Прочитал и узнал свой прошлый год.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Пусть висит, такие вопросы всплывают постоянно.
С выводом соглашусь, с обоснованием нет.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тот же вывод, только я шёл к нему дольше.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Пишите, если понадобится уточнить.
Сначала делал так же, потом переделал всё.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
Это началось после какого-то изменения?
Пробовали снизить темп вдвое?
Уберите лишние потоки, толку от них нет.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.