webzio-extended — не безымянный «краулер с целью, зависящей от оператора», а компонент реальной, известной компании веб-разведки Webz.io. По собственному описанию оператора, это не отдельный скрапер, а «бот-валидатор»: он проверяет уже собранные основным краулером Webz.io данные и помечает их как разрешённые или неразрешённые для использования в обучении AI/ML-моделей. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое webzio-extended на самом деле
Webz.io — компания, специализирующаяся на веб-данных: она поддерживает репозиторий данных сбора с открытого, глубокого и тёмного веба (новости, блоги, форумы, отзывы, соцсети) и продаёт доступ к нему другим компаниям, включая тех, кто использует данные для обучения AI-моделей. У Webz.io целое семейство ботов с общей историей: устаревший (legacy) omgili/omgilibot, основной краулер webzio (собирает и структурирует контент, применяет категоризацию и анализ тональности), и именно webzio-extended — «ответственный мост», который берёт уже собранные данные и выполняет этическую проверку, помечая их как пригодные или непригодные для AI/ML-целей.
Официальная документация Webz.io прямо описывает назначение этого конкретного UA: «определяет, разрешён ли собранный контент для использования в AI-сценариях». Обе строки — webzio и webzio-extended — включают прямую ссылку на публичную страницу webz.io/bot.html для прозрачности.
| Параметр | Значение |
| Название | webzio-extended |
| User-Agent (токен/паттерн) | webzio-extended (официальная строка: webzio-extended (+https://webz.io/bot.html), также встречается как Mozilla/5.0 (compatible; Webzio-Extended/1.0)) |
| Оператор | Webz.io — компания веб-разведки и данных для AI/аналитики |
| Назначение | По описанию оператора — проверка и маркировка уже собранных данных как разрешённых/неразрешённых для обучения AI-моделей; по данным сторонних каталогов — также описывается как самостоятельный AI data scraper |
| Список IP-адресов | ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA |
| Соблюдение robots.txt | Зависит от оператора; для большинства крупных краулеров — да, но часть сервисных/пользовательских fetch-агентов может обходить robots.txt |
| Используется для обучения моделей | Да — прямое назначение связано с определением пригодности данных для AI/ML-обучения |
| Категория TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Как работает webzio-extended
Идентифицируется в access.log по паттерну User-Agent webzio-extended. Практический смысл этого токена для владельца сайта: если вы согласны, чтобы контент участвовал в общей веб-разведке Webz.io (social listening, аналитика для сотен поисковых систем), но не хотите, чтобы он использовался для обучения AI-моделей, — блокировка именно webzio-extended при разрешённом основном webzio посылает оператору именно такой дифференцированный сигнал. Если нежелательны оба сценария — стоит блокировать все связанные токены семейства: omgili, omgilibot, webzio и webzio-extended.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий. Даже при умеренной средней частоте на одном домене возможны локальные всплески, похожие на L7-нагрузку: много 200 OK без роста реальных сессий. Признаки проблемной активности:
- рост RPS без роста конверсий;
- обход пагинации/каталога — широкие, объёмные проходы типичны для AI data scraper-ов этого класса;
- повторяющиеся запросы к тяжёлым страницам;
- давление на origin CPU и bandwidth, особенно во время активного цикла сбора данных.
Обнаружение в логах
# Все запросы
grep -i "webzio-extended" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "webzio-extended" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "webzio-extended" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "webzio-extended" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить соседние боты того же семейства
grep -iE "omgili|omgilibot|webzio" /var/log/nginx/access.log | wc -l
Верификация: User-Agent легко подделать. Для критичных решений дополнительно проверяйте IP/ASN, частоту, path-паттерны — а также проверьте, встречаются ли в логах соседние боты того же семейства Webz.io, что подтверждает согласованность с заявленной архитектурой компании:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt
# Полная блокировка User-agent: webzio-extended Disallow: / # Точечное ограничение User-agent: webzio-extended Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: webzio-extended Allow: /
Учитывайте: не все агенты строго соблюдают robots.txt. Если цель — полностью исключить контент из наборов данных Webz.io для AI, для полноты стоит добавить в файл все связанные токены семейства: omgili, omgilibot, webzio и webzio-extended — блокировка одного лишь webzio-extended не остановит основной сбор данных другим ботом того же оператора.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "webzio-extended") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=webzio-extended:10m rate=15r/m;
location / {
if ($http_user_agent ~* "webzio-extended") {
limit_req zone=webzio-extended burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} webzio-extended [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите webzio-extended, а заодно проверьте отдельные записи webzio, omgili, omgilibot того же оператора;
- для нежелательного сценария — категория «запретить» по всему семейству, если цель полностью исключить контент из AI-датасетов Webz.io;
- при необходимости используйте массовые операции allow/deny без правки origin;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
- решите отдельно для основного webzio (веб-разведка/аналитика) и webzio-extended (разрешение на AI-обучение) — это две разные политики, а не одна;
- не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Отдельно стоит помнить про legacy-токены omgili и omgilibot того же оператора — компания исторически заменяла их на связку webzio/webzio-extended, но старые записи могут ещё встречаться в трафике и требуют такого же решения.
Сводная таблица стратегии
| Цель сайта | Рекомендация |
| Согласны на веб-разведку Webz.io, но не на использование для AI | Allow для webzio, Disallow + запрет для webzio-extended |
| Не согласны ни на что из вышеперечисленного | Disallow + запрет в TrafficVeil для всего семейства (omgili, omgilibot, webzio, webzio-extended) |
| Нужен доступ, но беспокоит частота | Rate-limit вместо полной блокировки |
| Нежелательный бот по базе TrafficVeil | Запретить в /system/bots и контролировать по логам |