Разделы · Семантика и частотности
Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.
Частотности снимаю по двум регионам, дальше сравниваю. Сбор идёт вторые сутки, а прошло чуть больше половины.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Кто как это обходит?
Сначала делал так же, потом переделал всё.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Сохранил, пригодится в следующем проекте.
Добавлю то, что обычно выясняется поздно.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Расскажу, чем закончилось у меня.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Один замер стоит десяти рассуждений.
Данные теряются равномерно или кусками?
Так и есть, проходил через это в прошлом году.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Будет результат, напишите сюда.
Разнесите нагрузку по времени.
Разбирались втроём, нашли случайно.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
У нас на прошлом проекте это выглядело так.
Сезонность видно только на истории. Если собираете первый раз, отметьте дату сбора, через год она вам понадобится.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Такие темы и держат форум.
Совпадает с моим опытом до цифры.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
Расскажу, как выкручивались мы.
Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.
У меня это вскрылось только на сверке данных.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Отпишитесь, что получилось.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.