Разделы · Семантика и частотности
Прошу совета у тех, кто собирает регулярно и много.
Кратко по условиям.
Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Мусора после первого прохода около сорока процентов.
Может, есть путь проще, которого я не вижу.
Уберите лишние потоки, толку от них нет.
Проверяйте из той же программы. Браузер показывает своё.
Сколько это длится и с какой частотой повторяется?
Уточните пару моментов, иначе гадаем.
Начните с пробы на тысяче записей.
Сколько это длится и с какой частотой повторяется?
Проверяли на маленькой выборке?
Есть возможность повторить прогон и сравнить?
Был случай, когда всё сошлось только на третий день разбора.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тут не всё так однозначно, смотря какой объём.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Расскажу, как выкручивались мы.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Согласен целиком, добавлю только цифру.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Хороший вопрос, редко разбирают.
Соглашусь, хотя пришёл к этому через неприятность.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Какие паузы между запросами?
Есть возможность повторить прогон и сравнить?
Проверьте на второй машине, это отсекает половину версий.
А что показывают логи в момент падения?
Мы упирались в то же, пока не поменяли подход.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.