Разделы · Семантика и частотности
Разложил задачу на части и застрял на одной из них.
Что имеем на входе.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. После сбора из трёх источников дублей вышло около тридцати процентов.
Буду признателен за конкретику.
По адресам: берите там, где отдают целые подсети и не считают трафик. Я работаю через адреса с безлимитным трафиком, на прогонах по сто тысяч страниц ни разу не упирался в лимит по трафику.
У нас на прошлом проекте это выглядело так.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Держите нас в курсе.
Считайте по темпу, всё остальное вторично.
Всё верно написали выше, добавлю от себя пару деталей.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Начинал с того же, потом переделал.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Держите нас в курсе.
Полгода назад ловил то же самое.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Тут легко перепутать два разных момента.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Проверял на трёх проектах подряд, картина устойчивая.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.