Разделы · Семантика и частотности
Разложил задачу на части и застрял на одной из них.
Начну с цифр, они тут важнее слов.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. Источников три, объединяю их в одно ядро. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Есть мысли, куда копать?
Уменьшите потоки вдвое и замерьте заново.
До этого работало? Что менялось перед тем, как сломалось?
До этого работало? Что менялось перед тем, как сломалось?
На всех площадках или на одной конкретной?
На другой машине воспроизводится?
На маленьких объёмах верно, на больших уже нет.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Считаю так же, и цифры у меня близкие.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
По узким регионам данных мало всегда. Смотрите на порядок величины и на наличие спроса как такового. Точные числа там всё равно недостоверны.
Пишите, если понадобится уточнить.
Сохраняйте сырое, пересчитать успеете.
Проверял на четырёх проектах, вывод один.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
Что показывает простой запрос из консоли?
Сколько адресов и какой темп при этом стоит?
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.