Разделы · Семантика и частотности
Второй раз наступаю на одни грабли, решил спросить.
Коротко об условиях.
Источников три, объединяю их в одно ядро. Частотности снимаю по двум регионам, дальше сравниваю.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Подскажите, где я ошибаюсь.
Проверял на трёх проектах подряд, картина устойчивая.
Пустые ответы при живых адресах почти всегда означают, что площадка отдаёт заглушку. Проверяйте размер ответа.
Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.
Разбейте задачу на части.
Сколько потоков стоит на прогоне?
Уточните пару моментов, иначе гадаем.
От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.
Проверьте на второй машине, это отсекает половину версий.
Добавлю то, что обычно вылезает на второй месяц работы.
Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Спасибо за подробное описание, так отвечать проще.
Подтверждаю, у нас было ровно то же самое.
Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
На маленьких объёмах верно, на больших уже нет.
Точную частотность снимайте только по отобранным фразам. Гонять её по всему ядру дорого и почти всегда бесполезно.
По узким регионам данных мало всегда. Смотрите на порядок величины и на наличие спроса как такового. Точные числа там всё равно недостоверны.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Был похожий случай, разбирали неделю.
Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.
Маски проверяйте до запуска. Одна кривая маска даёт десятки тысяч мусорных фраз и съедает ночь.
Тема как раз вовремя, сам этим занят.
Пробовали снизить темп вдвое?
Сколько это длится и с какой частотой повторяется?
Так и есть, проходил через это в прошлом году.
Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
А что показывают логи в момент падения?
А что показывают логи в момент падения?
Какая версия программы стоит?
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.