Разделы · Семантика и частотности
Работал раньше на маленьких объёмах, тут всё иначе.
Что есть на руках.
Сбор идёт вторые сутки, а прошло чуть больше половины. Список масок на пять тысяч, глубина расширения три уровня. Держу 40 адресов, паузы ставлю случайные от секунды до трёх.
Буду признателен за конкретику.
У нас это вылезло на проекте с большим каталогом.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Сохранил, пригодится в следующем проекте.
Осторожнее с обобщением, случаи бывают разные.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
До сих пор помню, чем это закончилось.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Всё правильно расписано, повторю своими словами.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
Считайте по темпу, всё остальное вторично.
Был похожий случай, разбирали неделю.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Меняйте по одному, иначе не поймёте причину.
Уточнение по мелочи, но она стоит времени.
По узким регионам данных мало всегда. Смотрите на порядок величины и на наличие спроса как такового. Точные числа там всё равно недостоверны.
Добавлю то, что обычно вылезает на второй месяц работы.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Уточните пару моментов, иначе гадаем.
Что менялось за последнюю неделю?
Мы держали старую схему год, зря.
Точную частотность снимайте только по отобранным фразам. Гонять её по всему ядру дорого и почти всегда бесполезно.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Проверьте, что настройка вообще применилась.
Согласен целиком, добавлю только цифру.
Точную частотность снимайте только по отобранным фразам. Гонять её по всему ядру дорого и почти всегда бесполезно.
Сезонность видно только на истории. Если собираете первый раз, отметьте дату сбора, через год она вам понадобится.
Пишите, если понадобится уточнить.
Наступал на это в прошлом сезоне.
Пустые ответы при живых адресах почти всегда означают, что площадка отдаёт заглушку. Проверяйте размер ответа.
Проверял ровно это, картина совпала.
Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.