Разделы · Семантика и частотности
Есть наблюдение, хочу его проверить об вас.
Чтобы было понятно, с чем работаю.
Ядро около 100 тысяч фраз, нужны точные частотности по двум регионам. Держу 40 адресов, паузы ставлю случайные от секунды до трёх.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Что тут вообще считается нормой?
Проверьте, что ответ полный.
Скорость решает не всё, но и терять её не хочется. Я перешёл на адреса с безлимитным трафиком, когда старый поставщик начал резать канал на длинных прогонах.
Так делать можно, но есть путь короче.
По узким регионам данных мало всегда. Смотрите на порядок величины и на наличие спроса как такового. Точные числа там всё равно недостоверны.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Первый раз списал на случайность, второй раз уже нет.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
$ kc-cli --masks masks.txt --depth 3 --threads 40 собрано фраз: 214 880 отказов: 1 204
Жду продолжения.
Проверяли на маленькой выборке?
Какой объём и за какое окно?
Данные теряются равномерно или кусками?
Проверял это на своей задаче, вывод такой же.
Сбор частотностей упирается в темп. Мощность машины тут не помогает. Ускорение даёт только увеличение числа адресов и аккуратные паузы.
Тут не всё так однозначно, смотря какой объём.
Точную частотность снимайте только по отобранным фразам. Гонять её по всему ядру дорого и почти всегда бесполезно.
Маски проверяйте до запуска. Одна кривая маска даёт десятки тысяч мусорных фраз и съедает ночь.
Набор новых участников сейчас приостановлен. Читать форум можно без учётной записи, все темы открыты.
Когда набор откроют, объявление появится в разделе с короткими вопросами.
Форма работает в браузере и никуда ничего не отправляет.