Разделы · Семантика и частотности
Расскажу, что делаю сейчас, и спрошу, где ошибаюсь.
Даю всё, что есть, вдруг зацепитесь за деталь.
Список масок на пять тысяч, глубина расширения три уровня. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Хочется услышать цифры от практиков.
Проверьте, что настройка вообще применилась.
Скорость решает не всё, но и терять её не хочется. Я перешёл на адреса с безлимитным трафиком, когда старый поставщик начал резать канал на длинных прогонах.
Добавлю то, что обычно вылезает на второй месяц работы.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Долго держал старую схему, пока не упёрся.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Тема нужная, подписался.
Какая версия программы и что с настройками по умолчанию?
Сколько адресов и какой темп при этом стоит?
Это на всех площадках или на одной?
Подтверждаю, у нас было ровно то же самое.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Одно уточнение, иначе расчёт уедет.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.