позиции · сбор данных · отчёты
реклама IPrazon Network: приватные прокси IPv4 и SOCKS5, около 12 000 адресов, безлимитный трафик, тест до 2 часов

Разделы · Семантика и частотности

Wordstat по регионам: сколько адресов на 50 регионов

5 ответов · 1 686 просмотров
знак участника Ким Р.
Ким Р.Новичок
  • сообщений 214
  • на форуме 1 года
Семантика и частотности

Собираю ядро под крупный проект, объём большой, и вот вопрос по ходу.

После сбора из трёх источников дублей вышло около тридцати процентов. Проверял на выборке в тысячу фраз, там всё гладко. Сбор идёт вторые сутки, а прошло чуть больше половины.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204

Кто сталкивался, поделитесь опытом.

знак участника Ефим Гладков
Ефим ГладковУчастник
  • сообщений 850
  • на форуме 9 мес
полезный ответ
Ким Р. писал: Wordstat по регионам: сколько адресов на 50 …

Расскажу, чем закончилось у меня.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

знак участника Мельник И.
Мельник И.Знаток
  • сообщений 1 655
  • на форуме 3 мес

Начинал с того же, потом переделал.

Расширение по подсказкам останавливаю, когда прирост новых фраз падает ниже пяти процентов за проход. Дальше растёт только мусор.

Чистку делаю в два прохода: сначала стоп-слова и явный мусор, потом ручной просмотр верхушки по частотности. Низ списка руками не трогаю.

знак участника logi_i_grafiki
logi_i_grafikiУчастник
  • сообщений 895
  • на форуме 9 мес
полезный ответ

От себя добавлю по железу под адреса: своё оборудование у поставщика заметно ровнее аренды чужого. Беру адреса IPv4 и SOCKS5 без лимита по трафику как раз поэтому.

знак участника Шамиль Н.
Шамиль Н.Участник
  • сообщений 1 135
  • на форуме 6 мес

Подтверждаю, у нас было ровно то же самое.

Сбор частотностей упирается в темп, а не в мощность машины. Ускорение даёт только увеличение числа адресов и аккуратные паузы.

знак участника Погодин
ПогодинУчастник
  • сообщений 942
  • на форуме 6 мес

У нас на прошлом проекте это выглядело так.

Дубли после сбора из трёх источников это норма. Приводите фразы к одному виду до сравнения: нижний регистр, порядок слов, лишние пробелы.

$ kc-cli --masks masks.txt --depth 3 --threads 40
собрано фраз: 214 880
отказов: 1 204

Отпишитесь, чем закончится, тема полезная.

Ответить в темеПодписаться

Рядом в разделе

Сеометр, форум специалистов по поиску и аналитике ПравилаУчастникиО форумеЛента 2026