Watchbot — ещё один случай в этой энциклопедии, когда открытые источники не дают уверенного ответа «кто это». Несмотря на поиск по нескольким направлениям (мониторинговые сервисы, инструменты автоматизации, интеграционные боты), отдельной документации, официального сайта оператора или чёткого описания назначения именно для этого токена найти не удалось. В каталоге TrafficVeil бот отмечен как легитимный в категории «Прочие краулеры и сервисы».
Что такое Watchbot на самом деле
Само название («смотрящий бот») предполагает функцию мониторинга или наблюдения — это может быть аптайм-чекер, инструмент отслеживания изменений на странице, компонент системы уведомлений или что-то ещё в этом смысловом поле. Но название само по себе — не доказательство: подобные общие имена нередко используют разные, не связанные друг с другом сервисы и внутренние скрипты компаний. Прямого подтверждения от известного публичного оператора под этим именно названием не нашлось.
| Параметр | Значение |
| Название | Watchbot |
| User-Agent (токен/паттерн) | watchbot |
| Оператор | Не подтверждён публично; название предполагает функцию мониторинга/наблюдения, но это не доказанный факт |
| Назначение | Судя по названию — вероятно мониторинг или отслеживание изменений; официально не задокументировано |
| Список IP-адресов | ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA |
| Соблюдение robots.txt | Зависит от оператора; для большинства крупных краулеров — да, но часть сервисных/пользовательских fetch-агентов может обходить robots.txt |
| Используется для обучения моделей | Не задокументировано явно |
| Категория TrafficVeil | Легитимный / Прочие краулеры и сервисы |
Как работает Watchbot
Идентифицируется в access.log по паттерну User-Agent watchbot. Выполняет автоматические HTTP(S)-запросы к публичным URL сайта. Без подтверждённого оператора точный ответ на «зачем» дать нельзя — практический путь: посмотреть, какие именно URL затрагивает бот на вашем конкретном домене, частоту визитов и глубину обхода, и сопоставить их с известными интеграциями или подписками сайта, а не полагаться на общую теорию по названию.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий. Даже при умеренной средней частоте на одном домене возможны локальные всплески, похожие на L7-нагрузку: много 200 OK без роста реальных сессий. Признаки проблемной активности:
- рост RPS без роста конверсий;
- обход пагинации/каталога;
- повторяющиеся запросы к тяжёлым страницам;
- давление на origin CPU и bandwidth.
Обнаружение в логах
# Все запросы
grep -i "watchbot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "watchbot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "watchbot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "watchbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация здесь особенно важна из-за отсутствия подтверждённого публичного оператора: смотрите связку UA + ASN/IP + частоту + набор URL, а не доверяйте одной строке заголовка. Узкий набор URL с регулярным интервалом больше похож на мониторинг; широкий и хаотичный обход — повод присмотреться внимательнее.
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt
# Полная блокировка User-agent: watchbot Disallow: / # Точечное ограничение User-agent: watchbot Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: watchbot Allow: /
Учитывайте: не все агенты строго соблюдают robots.txt, а без подтверждённого оператора гарантий здесь ещё меньше обычного. Для гарантированного контроля используйте серверные правила или TrafficVeil.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "watchbot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=watchbot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "watchbot") {
limit_req zone=watchbot burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} watchbot [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите watchbot / Watchbot;
- прежде чем блокировать, сопоставьте затронутые URL с известными интеграциями сайта — так меньше риск случайно сломать нужный сервис;
- при необходимости используйте массовые операции allow/deny без правки origin;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- Оценивайте пользу по факту, а не по названию: если после проверки логов связи с известной интеграцией не нашлось — блокируйте или rate-limit;
- не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403;
- контент лучше отдавать server-side, если хотите контролируемую индексацию легитимными агентами.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 2ip Bot | Прочие краулеры и сервисы | 2ip bot | легитимный |
| AccessStatus | Прочие краулеры и сервисы | accessstatus | легитимный |
| AddThis.com | Прочие краулеры и сервисы | addthis.com | легитимный |
| Agent | Прочие краулеры и сервисы | agent | легитимный |
| AgentReadinessScanner | Прочие краулеры и сервисы | agentreadinessscanner | легитимный |
Сводная таблица стратегии
| Цель сайта | Рекомендация |
| Затронутые URL совпадают с известной интеграцией сайта | Allow / разрешить в TrafficVeil |
| Связь с реальной интеграцией не подтвердилась | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Источник неясен, но нагрузка мешает | Rate-limit как промежуточный шаг вместо немедленной полной блокировки |
| Оператор не подтверждён, польза не установлена | Запретить в /system/bots и контролировать по логам |