позиции · сбор данных · отчёты
реклама IPrazon Network: приватные прокси IPv4 и SOCKS5, около 12 000 адресов, безлимитный трафик, тест до 2 часов

Разделы · Семантика и частотности

Кластеризация 30 тысяч запросов: чем считаете пересечения

12 ответов · 3 144 просмотров
знак участника nochnoy_progon
nochnoy_progonЗнаток
  • сообщений 1 540
  • на форуме 5 мес
Семантика и частотностигорячая

Прошу совета у тех, кто собирает регулярно и много.

Что имеем на входе.

Сбор идёт вторые сутки, а прошло чуть больше половины. Список масок на пять тысяч, глубина расширения три уровня. Кластеризация просит свежие топы, а это отдельный прогон и отдельный расход.

Хочется услышать цифры от практиков.

прогоны ставлю на три часа ночи
знак участника Сергей Птицын
Сергей ПтицынУчастник
  • сообщений 1 165
  • на форуме 6 мес
nochnoy_progon писал: Кластеризация 30 тысяч запросов: чем считает…

Считайте по темпу, всё остальное вторично.

знак участника Жигарев
ЖигаревНовичок
  • сообщений 178
  • на форуме 1 года

У меня картина совпадает почти полностью.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.

знак участника Марат Илюхин
Марат ИлюхинЗнаток
  • сообщений 2 295
  • на форуме 3 мес

Согласен с предыдущим ответом, но с одной оговоркой.

Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.

Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.

знак участника Женя Кольцов
Женя КольцовУчастник
  • сообщений 1 270
  • на форуме 8 мес

Считайте по темпу, всё остальное вторично.

знак участника Наиля Ш.
Наиля Ш.Новичок
  • сообщений 505
  • на форуме 1 года

Почти так, но одна деталь меняет вывод.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204

Отпишитесь, чем закончится, тема полезная.

знак участника Юля Радько
Юля РадькоНовичок
  • сообщений 385
  • на форуме 1 года

Разбейте прогон на части, станет ровнее.

знак участника Панкратов
ПанкратовУчастник
  • сообщений 745
  • на форуме 10 мес

Расскажу, чем закончилось у меня.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

Держите нас в курсе.

знак участника Ханин П.
Ханин П.Знаток
  • сообщений 2 280
  • на форуме 2 мес

Смотрите подсети, а не только число адресов.

знак участника Пётр Улесов
Пётр УлесовУчастник
  • сообщений 625
  • на форуме 11 мес

Начинал с того же, потом переделал.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.

знак участника Богдан Ярош
Богдан ЯрошУчастник
  • сообщений 990
  • на форуме 7 мес

Был случай, когда всё сошлось только на третий день разбора.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Лунёва А.
Лунёва А.Новичок
  • сообщений 356
  • на форуме 1 года

Тут есть тонкость, о которой обычно забывают.

Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

знак участника Ильдар М.
Ильдар М.Участник
  • сообщений 1 010
  • на форуме 7 мес

Почти так, но одна деталь меняет вывод.

По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.

Ответить в темеПодписаться

Рядом в разделе

Сеометр, форум специалистов по поиску и аналитике ПравилаУчастникиО форумеЛента 2026