Разделы · Семантика и частотности
Работал раньше на маленьких объёмах, тут всё иначе.
Ниже вводные, дальше сам вопрос.
После сбора из трёх источников дублей вышло около тридцати процентов. Держу 40 адресов, паузы ставлю случайные от секунды до трёх. Сбор идёт вторые сутки, а прошло чуть больше половины.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Кто как это обходит?
Разбейте прогон на части, станет ровнее.
А что показывают логи в момент падения?
А что показывают логи в момент падения?
Какая версия программы и что с настройками по умолчанию?
Уточните пару моментов, иначе гадаем.
Почти так, но одна деталь меняет вывод.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Считаю так же, и цифры у меня близкие.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.
Хороший разбор, добавлю в закладки.
Начните с малого объёма и растите постепенно.
Долго держал старую схему, пока не упёрся.
Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.
Какая версия программы и что с настройками по умолчанию?
Уточните пару моментов, иначе гадаем.