позиции · сбор данных · отчёты
реклама IPrazon Network: приватные прокси IPv4 и SOCKS5, около 12 000 адресов, безлимитный трафик, тест до 2 часов

Разделы · Семантика и частотности

Дубли в семантике после сбора из трёх источников

15 ответов · 2 675 просмотров
знак участника Артём Гринь
Артём ГриньУчастник
  • сообщений 1 284
  • на форуме 4 мес
Семантика и частотности

Ядро большое, времени мало, хочется понять правильный порядок.

Условия задачи вот такие.

Сбор идёт вторые сутки, а прошло чуть больше половины. Список масок на пять тысяч, глубина расширения три уровня. После сбора из трёх источников дублей вышло около тридцати процентов.

Дубли в семантике после сбора из трёх источников: разбор в цифрах
Дубли в семантике после сбора из трёх источников: как это выглядит у меня

Подскажите, где я ошибаюсь.

сбор для агентства, 60 проектов
знак участника Полина Ржевская
Полина РжевскаяУчастник
  • сообщений 715
  • на форуме 10 мес
полезный ответ
Артём Гринь писал: Дубли в семантике после сбора из трёх источн…

Полгода назад ловил то же самое.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

Хороший разбор, добавлю в закладки.

знак участника thread_limit
thread_limitЗнаток
  • сообщений 2 620
  • на форуме 2 мес

Осторожнее с этим выводом, он верен не всегда.

Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.

знак участника Григорий Сташ
Григорий СташНовичок
  • сообщений 172
  • на форуме 1 года

Долго держал старую схему, пока не упёрся.

Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Мамедов А.
Мамедов А.Новичок
  • сообщений 240
  • на форуме 1 года
Артём Гринь писал: Дубли в семантике после сбора из трёх источн…

Тут ничего нового не скажу, только подтвержу.

Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.

Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.

знак участника grafik_cen
grafik_cenЗнаток
  • сообщений 1 720
  • на форуме 4 мес

Считайте по темпу, всё остальное вторично.

знак участника Тарас Ю.
Тарас Ю.Новичок
  • сообщений 480
  • на форуме 1 года

Проверял на трёх проектах подряд, картина устойчивая.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

знак участника Ростислав Е.
Ростислав Е.Участник
  • сообщений 965
  • на форуме 7 мес
Артём Гринь писал: Дубли в семантике после сбора из трёх источн…

Держите запас, ровно по расчёту работать не выйдет.

знак участника tochka_zamera
tochka_zameraВетеран
  • сообщений 3 355
  • на форуме 1 мес
Артём Гринь писал: Дубли в семантике после сбора из трёх источн…

Тут легко перепутать два разных момента.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

знак участника Виктор Лаптев
Виктор ЛаптевНовичок
  • сообщений 230
  • на форуме 1 года

Одно уточнение, иначе расчёт уедет.

Точная частотность в кавычках собирается медленнее обычной, потому что это отдельный запрос. Закладывайте на неё втрое больше времени.

знак участника nochnoy_progon
nochnoy_progonЗнаток
  • сообщений 1 540
  • на форуме 5 мес

Уточните пару моментов, иначе гадаем.

Это на всех площадках или на одной?

знак участника pool_manager
pool_managerЗнаток
  • сообщений 1 580
  • на форуме 5 мес

Начинал с того же, потом переделал.

Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Маргарита Ю.
Маргарита Ю.Участник
  • сообщений 640
  • на форуме 11 мес

Разбейте прогон на части, станет ровнее.

знак участника tempo_ru
tempo_ruЗнаток
  • сообщений 2 470
  • на форуме 3 мес

Проверял это на своей задаче, вывод такой же.

Кластеризация по выдаче требует свежих топов. Если топам больше недели, кластеры разъезжаются, и это видно на глаз.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

Хороший разбор, добавлю в закладки.

знак участника zapros_min
zapros_minУчастник
  • сообщений 760
  • на форуме 10 мес

Полгода назад ловил то же самое.

По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.

знак участника Артур Хаким
Артур ХакимНовичок
  • сообщений 455
  • на форуме 1 года

Проверял это на своей задаче, вывод такой же.

По узким регионам данных мало всегда. Смотрите не на точные числа, а на порядок величины и на наличие спроса как такового.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
Ответить в темеПодписаться

Рядом в разделе

Сеометр, форум специалистов по поиску и аналитике ПравилаУчастникиО форумеЛента 2026