Разделы · Семантика и частотности
Разложил задачу на части и застрял на одной из них.
Вводные, чтобы не гадать.
Частотности снимаю по двум регионам, дальше сравниваю. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Проверял на выборке в тысячу фраз, там всё гладко.
Может, кто-то уже проходил это.
Проверить это можно бесплатно: у адреса с безлимитным трафиком есть тест на пару часов, за это время как раз успеваете прогнать пробу и посмотреть, как ведут себя ваши потоки.
Работает, пока не выросли объёмы.
Маски проверяйте до запуска. Одна кривая маска даёт десятки тысяч мусорных фраз и съедает ночь.
Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
А что показывают логи в момент падения?
Пробовали на другой машине?
Схема рабочая, но у неё есть предел.
Внутренний поиск конкурента даёт живые формулировки, которых нет в подсказках. Источник недооценённый.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
У нас это вылезло на проекте с большим каталогом.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Точную частотность снимайте только по отобранным фразам. Гонять её по всему ядру дорого и почти всегда бесполезно.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.