Разделы · Семантика и частотности
Работал раньше на маленьких объёмах, тут всё иначе.
Начну с цифр, они тут важнее слов.
Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Сбор идёт вторые сутки, а прошло чуть больше половины.
Кто сталкивался, поделитесь опытом.
Проверить это можно бесплатно: у адреса с безлимитным трафиком есть тест на пару часов, за это время как раз успеваете прогнать пробу и посмотреть, как ведут себя ваши потоки.
Работает, пока объём небольшой. Дальше правила другие.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Уточните пару моментов, иначе гадаем.
Сколько адресов и какой темп при этом стоит?
Работает, пока объём небольшой. Дальше правила другие.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Полгода назад ловил то же самое.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204