Разделы · Семантика и частотности
Второй раз наступаю на одни грабли, решил спросить.
Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход. Держу 40 адресов, паузы ставлю случайные от секунды до трёх. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Есть у кого рабочая схема?
Долго держал старую схему, пока не упёрся.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Разбирались втроём, нашли случайно.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Тут ничего нового не скажу, только подтвержу.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Расскажу, чем закончилось у меня.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Если поможет, напишите здесь же, пригодится следующим.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.