Разделы · Семантика и частотности
Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.
После сбора из трёх источников дублей вышло около тридцати процентов. Проверял на выборке в тысячу фраз, там всё гладко. Сбор идёт вторые сутки, а прошло чуть больше половины.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Кто сталкивался, поделитесь опытом.
Расскажу, чем закончилось у меня.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Начинал с того же, потом переделал.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Подтверждаю, у нас было ровно то же самое.
Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
У нас на прошлом проекте это выглядело так.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Отпишитесь, чем закончится, тема полезная.