Разделы · Семантика и частотности
Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.
Постараюсь коротко.
Сбор идёт вторые сутки, а прошло чуть больше половины. После сбора из трёх источников дублей вышло около тридцати процентов.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Подскажите, где я ошибаюсь.
У меня это вскрылось только на сверке данных.
Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Долго держал старую схему, пока не упёрся.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Один замер стоит десяти рассуждений.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Начните с малого объёма и растите постепенно.
Мы решили это переносом прогона на другое время.
Сезонность видно только на истории. Если собираете первый раз, отметьте дату сбора, через год она вам понадобится.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Добавлю тему в закладки.
У меня картина совпадает почти полностью.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Могу подтвердить, у нас на двух проектах точно так.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Сохранил, пригодится в следующем проекте.
Поправлю: дело в темпе, объём тут вторичен.
Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Именно так и есть, спорить не о чем.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Плюсую, сам пришёл к тому же через полгода проб.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Расскажу, как выкручивались мы.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Добавлю то, что обычно выясняется поздно.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Полезный разбор получился.
Данные теряются равномерно или кусками?
Совпадает с моим опытом до цифры.
Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.
Добавлю то, что обычно вылезает на второй месяц работы.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Разбор годный, спорить не буду.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.