WARDBot — редкий и показательный случай в этой энциклопедии: два независимых открытых источника приписывают один и тот же токен двум разным, не связанным друг с другом операторам. Официальная страница ward.ai/robot подробно описывает WARDBot как собственный бот аптайм-мониторинга сервиса W.A.R.D. При этом открытый community-реестр AI-краулеров (ai.robots.txt) относит тот же токен к совершенно другой компании — WEBSPARK, называя его AI data scraper с неясным назначением. Именно поэтому для этого бота верификация через reverse DNS важна не как формальность, а как единственный надёжный способ понять, с кем вы имеете дело в конкретном случае. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое WARDBot: версия первая — W.A.R.D.
По официальному описанию сервиса ward.ai, WARDBot — бот мониторинга, который отслеживает URL-адреса, добавленные пользователями сервиса в список наблюдения, проверяя код статуса страницы, чтобы вовремя уведомить о простое. Официальная строка UA: Mozilla/5.0 (compatible; WARDBot/1.0; http://ward.ai/robot). Средняя частота запросов — раз в 10 минут или реже. По умолчанию используется HTTP/2, но может применяться и HTTP/1. Оператор прямо заявляет строгое соблюдение robots.txt, включая директиву Crawl-delay, и публикует reverse DNS суффикс для верификации: .robot.ward.host.
Что такое WARDBot: версия вторая — WEBSPARK
Независимый открытый community-реестр AI-краулеров (ai.robots.txt) описывает WARDBot иначе — как AI data scraper, оператором которого указана компания WEBSPARK. Источник прямо отмечает: «в настоящее время неизвестно, связан ли этот бот с искусственным интеллектом» — то есть даже сам реестр не уверен в точности классификации. Никаких деталей о частоте, поведении или соблюдении robots.txt для этой версии не приводится.
| Параметр | Значение |
| Название | WARDBot |
| User-Agent (токен/паттерн) | wardbot (официальная строка версии W.A.R.D.: Mozilla/5.0 (compatible; WARDBot/1.0; http://ward.ai/robot)) |
| Оператор | Расходится по источникам: либо W.A.R.D. (сервис мониторинга, ward.ai), либо WEBSPARK (по данным community-реестра ai.robots.txt) — вероятно, два разных бота с совпадающим именем |
| Назначение | Версия W.A.R.D.: отслеживание URL из пользовательского списка мониторинга. Версия WEBSPARK: сбор данных, назначение не уточнено |
| Список IP-адресов | ❌ Отдельного полного списка IP не публикуется ни одной из версий; для W.A.R.D. есть reverse DNS суффикс .robot.ward.host для верификации |
| Соблюдение robots.txt | Версия W.A.R.D. официально заявляет строгое соблюдение, включая Crawl-delay; для версии WEBSPARK данных нет |
| Используется для обучения моделей | Не задокументировано ни для одной из версий |
| Категория TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем WARDBot приходит на сайт
Если это версия W.A.R.D. — логика та же, что и у любого мониторинга: кто-то добавил ваш URL в список наблюдения сервиса, и бот периодически (не чаще раза в 10 минут) проверяет его доступность. Если это версия WEBSPARK — назначение открыто не раскрыто даже независимым реестром, поэтому определённого ответа дать нельзя.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий. Даже при умеренной средней частоте на одном домене возможны локальные всплески, похожие на L7-нагрузку: много 200 OK без роста реальных сессий. Признаки проблемной активности:
- рост RPS без роста конверсий;
- обход пагинации/каталога — нехарактерно для заявленной версии W.A.R.D. (узкий мониторинг конкретных URL), но возможно для неопознанной версии WEBSPARK;
- повторяющиеся запросы к тяжёлым страницам;
- давление на origin CPU и bandwidth.
Обнаружение в логах и верификация — здесь особенно важно
# Все запросы
grep -i "wardbot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "wardbot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "wardbot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "wardbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Учитывая конфликт атрибуции между источниками, для этого бота стандартная рекомендация «проверяйте IP/ASN» становится обязательной, а не факультативной. Сделайте обратный DNS-запрос по IP из логов: если результат заканчивается на .robot.ward.host, это подтверждает версию W.A.R.D.; если хостнейм не совпадает — вы, вероятно, имеете дело с другим ботом под тем же именем, и стоит относиться к нему с большей осторожностью:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
Также проверьте частоту: если запросы идут заметно чаще, чем раз в 10 минут, это тоже не соответствует заявленному поведению W.A.R.D. и указывает на другой источник или подделку UA.
robots.txt
# Полная блокировка User-agent: wardbot Disallow: / # Точечное ограничение User-agent: wardbot Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: wardbot Allow: /
Официальная версия W.A.R.D. заявляет строгое соблюдение robots.txt, включая Crawl-delay. Но раз для того же имени существует неподтверждённая альтернативная версия от WEBSPARK, полагаться только на файл рискованно — дополните его серверным контролем.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "wardbot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=wardbot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "wardbot") {
limit_req zone=wardbot burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} wardbot [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите wardbot / WARDBot;
- прежде чем разрешать, сверьте reverse DNS хотя бы части запросов — это единственный надёжный способ отличить версию W.A.R.D. от неопознанной альтернативы;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit, особенно с учётом неопределённости в атрибуции;
- если reverse DNS подтверждает
.robot.ward.hostи вы (или ваш подрядчик) действительно используете сервис мониторинга W.A.R.D. — allow оправдан; - не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Сводная таблица стратегии
| Ситуация | Действие |
| Reverse DNS подтверждает .robot.ward.host, сервис W.A.R.D. используется вами | Allow / разрешить в TrafficVeil |
| Reverse DNS не совпадает или проверить не удалось | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Частота запросов заметно выше заявленных 10 минут W.A.R.D. | Повод усомниться в подлинности — вероятен спуфинг или другой оператор |
| Нежелательный бот по базе TrafficVeil, атрибуция не подтверждена | Запретить в /system/bots и контролировать по логам |