позиции · сбор данных · отчёты
реклама IPrazon Network: приватные прокси IPv4 и SOCKS5, пул 12 000 адресов, безлимитный трафик, бесплатный тест до 2 часов

Разделы · Семантика и частотности

Частотности расходятся между Wordstat и сервисами, кому верить

15 ответов · 3 965 просмотров
знак участника Стрельцов
СтрельцовУчастник
  • сообщений 1 080
  • на форуме 7 мес
Семантика и частотностигорячая

Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.

Постараюсь коротко.

Сбор идёт вторые сутки, а прошло чуть больше половины. После сбора из трёх источников дублей вышло около тридцати процентов.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
Частотности расходятся между Wordstat и сервисами, кому верить: разбор в цифрах
Частотности расходятся между Wordstat и сервисами, кому верить: как это выглядит у меня

Подскажите, где я ошибаюсь.

знак участника Алина Прошина
Алина ПрошинаНовичок
  • сообщений 140
  • на форуме 1 года
Стрельцов писал: Частотности расходятся между Wordstat и серв…

У меня это вскрылось только на сверке данных.

Собирайте частотности пачками и сохраняйте после каждой. Прогон на сутки без промежуточного сохранения это лотерея.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Симаков
СимаковУчастник
  • сообщений 780
  • на форуме 9 мес

Долго держал старую схему, пока не упёрся.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

знак участника Саша Верхов
Саша ВерховНовичок
  • сообщений 152
  • на форуме 1 года

Один замер стоит десяти рассуждений.

знак участника Тимофей Бек
Тимофей БекУчастник
  • сообщений 610
  • на форуме 11 мес
полезный ответ
Стрельцов писал: Частотности расходятся между Wordstat и серв…

От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.

Начните с малого объёма и растите постепенно.

знак участника Тереза К.
Тереза К.Ветеран
  • сообщений 3 907
  • на форуме 1 мес

Мы решили это переносом прогона на другое время.

Сезонность видно только на истории. Если собираете первый раз, отметьте дату сбора, через год она вам понадобится.

Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.

Добавлю тему в закладки.

знак участника Тучков
ТучковНовичок
  • сообщений 430
  • на форуме 1 года

У меня картина совпадает почти полностью.

Ядро версионируйте. Через полгода вопрос «а что мы собирали в прошлый раз» возникает обязательно.

знак участника Захаров Л.
Захаров Л.Участник
  • сообщений 1 310
  • на форуме 8 мес

Могу подтвердить, у нас на двух проектах точно так.

Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.

Сохранил, пригодится в следующем проекте.

знак участника Эдуард Мель
Эдуард МельУчастник
  • сообщений 730
  • на форуме 10 мес
Стрельцов писал: Частотности расходятся между Wordstat и серв…

Поправлю: дело в темпе, объём тут вторичен.

Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Гаврилин
ГаврилинУчастник
  • сообщений 1 330
  • на форуме 8 мес

Именно так и есть, спорить не о чем.

Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.

Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.

знак участника Вадим Кучер
Вадим КучерНовичок
  • сообщений 165
  • на форуме 1 года

Плюсую, сам пришёл к тому же через полгода проб.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.

знак участника Нина Караваева
Нина КараваеваУчастник
  • сообщений 1 025
  • на форуме 7 мес

Расскажу, как выкручивались мы.

Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.

Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204
знак участника Ирина Долева
Ирина ДолеваНовичок
  • сообщений 588
  • на форуме 11 мес
Стрельцов писал: Частотности расходятся между Wordstat и серв…

Добавлю то, что обычно выясняется поздно.

Разделение коммерческих и информационных запросов надёжнее делать по выдаче. Слова-маркеры дают слишком много ошибок.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204

Полезный разбор получился.

знак участника Айгуль Р.
Айгуль Р.Новичок
  • сообщений 440
  • на форуме 1 года

Данные теряются равномерно или кусками?

знак участника Дарья Смолина
Дарья СмолинаУчастник
  • сообщений 820
  • на форуме 9 мес

Совпадает с моим опытом до цифры.

Обновляйте ядро частями. Полный пересбор раз в квартал нужен редко, обычно достаточно освежить верхушку и добрать новое.

знак участника Бабенко Д.
Бабенко Д.Новичок
  • сообщений 402
  • на форуме 1 года
Стрельцов писал: Частотности расходятся между Wordstat и серв…

Добавлю то, что обычно вылезает на второй месяц работы.

Приводите фразы к общему виду до сравнения, иначе дубли расползаются по всему ядру и всплывают на кластеризации.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204

Разбор годный, спорить не буду.

Ответить в темеПодписаться

Рядом в разделе

Сеометр, форум специалистов по поиску и аналитике ПравилаУчастникиО форумеЛента 2026