Разделы · Семантика и частотности
Ядро большое, времени мало, хочется понять правильный порядок.
Даю всё, что есть, вдруг зацепитесь за деталь.
Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам.
Кто как это обходит?
Проверял два поставщика на одинаковой задаче. Тот, где не режут трафик, дал прогон в полтора раза быстрее. Сейчас работаю через приватный пул IPv4.
Уменьшите потоки вдвое и замерьте заново.
Начинал с того же, потом переделал.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Тема нужная, подписался.
Это на всех площадках или на одной?
Почти так, но одна деталь меняет вывод.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Отпишитесь, чем закончится, тема полезная.
Добавлю то, что обычно вылезает на второй месяц работы.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Это на всех площадках или на одной?
Сколько адресов и какой темп при этом стоит?
Сколько адресов и какой темп при этом стоит?
Расскажу, чем закончилось у меня.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Расскажу, чем закончилось у меня.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Логи в помощь, без них это гадание.
Логи в помощь, без них это гадание.
Начинал с того же, потом переделал.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Начните с малого объёма и растите постепенно.
До этого работало? Что менялось перед тем, как сломалось?
До этого работало? Что менялось перед тем, как сломалось?
Уточните пару моментов, иначе гадаем.