Разделы · Семантика и частотности
Расскажу, что делаю сейчас, и спрошу, где ошибаюсь.
После сбора из трёх источников дублей вышло около тридцати процентов. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Как считаете вы? Интересует порядок, а не общие слова.
Одно уточнение, иначе расчёт уедет.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Хороший разбор, добавлю в закладки.
Разбейте прогон на части, станет ровнее.
Осторожнее с этим выводом, он верен не всегда.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Начинал с того же, потом переделал.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Полгода назад ловил то же самое.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Отпишитесь, чем закончится, тема полезная.
Одно уточнение, иначе расчёт уедет.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
А что показывают логи в момент падения?
Подтверждаю, у нас было ровно то же самое.
По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Пришёл к этому не сразу, сначала сделал ошибку.
Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.
Держите запас, ровно по расчёту работать не выйдет.
Почти так, но одна деталь меняет вывод.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Держите нас в курсе.
Проверьте, что настройка вообще применилась.
Проверьте, что настройка вообще применилась.
Разбейте прогон на части, станет ровнее.
На другой машине воспроизводится?
До этого работало? Что менялось перед тем, как сломалось?