В отличие от многих ботов с непрозрачным происхождением, у ZanistaBot есть конкретный владелец: строка User-Agent ссылается на зарегистрированную в Великобритании компанию Zanista AI, разрабатывающую генеративные ИИ-продукты для EdTech и FinTech. Это не делает его автоматически безопасным для нагрузки на сервер — TrafficVeil по-прежнему относит его к нежелательным, — но меняет то, как стоит проверять и объяснять его активность в логах. Ниже — как распознать агент, оценить нагрузку и настроить доступ через robots.txt, веб-сервер или TrafficVeil.
Что такое ZanistaBot и кто им управляет
Полная строка User-Agent бота выглядит так: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ZanistaBot/1.0; +https://zanista.ai/crawler-info) Chrome/W.X.Y.Z Safari/537.36. Домен в строке принадлежит Zanista AI Ltd — лондонской компании (зарегистрирована в августе 2023 года), которая создаёт генеративные ИИ-инструменты, включая продукты для автоматизации в образовании и финансах, например сервис анализа тональности финансовых новостей на базе ИИ. Судя по профилю компании, обход веб-страниц этим агентом, скорее всего, служит сбором и анализом текстового контента для таких ИИ-продуктов, а не индексацией для поиска и не улучшением сайта, который он посещает.
Как работает ZanistaBot
- Идентифицируется в access.log по паттерну User-Agent
zanistabot; - Выполняет автоматические HTTP(S)-запросы к публичным URL сайта, судя по формату UA — по расписанию или из очереди задач, а не по клику конкретного пользователя;
- Хотя бот и указывает при себе ссылку на «crawler-info» страницу — на практике эта страница у Zanista AI требует JavaScript для отображения и на момент проверки не отдаёт читаемого текста через простой запрос, то есть по факту не даёт владельцу сайта проверяемой информации о правилах обхода;
- В панели TrafficVeil относится к кластеру «Прочие краулеры и сервисы» с меткой «нежелательный» и может быть запрещён или ограничен точечно.
Соблюдение robots.txt: явно не подтверждено
По данным независимых трекеров ботов, отслеживавших активность ZanistaBot, факт соблюдения им robots.txt отмечен как неизвестный — то есть ни подтверждения, ни опровержения через прямое наблюдение нет. При этом сам факт, что бот в принципе прописывает в UA-строке ссылку на «info»-страницу, обычно указывает на попытку выглядеть как добросовестный краулер по формальным признакам. Разумная стратегия — не делать предположений в его пользу и относиться к директиве robots.txt как к сигнальной, а не гарантированной мере, полагаясь в первую очередь на серверные правила или TrafficVeil.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка на сервер
На отдельных доменах поведение ZanistaBot может выглядеть как волна автоматических запросов без пользовательских сессий: много ответов 200 OK без роста реальных визитов. Признаки, на которые стоит обращать внимание:
- рост RPS без роста конверсий;
- обход пагинации или каталога, характерный для сбора контента впрок, а не для точечной проверки;
- повторяющиеся запросы к тяжёлым, насыщенным текстом страницам — логично для агента, собирающего материал для ИИ-анализа;
- давление на origin CPU и bandwidth при отсутствии соответствующего роста бизнес-метрик.
Как найти бота в логах
# Все запросы
grep -i "zanistabot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "zanistabot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "zanistabot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "zanistabot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: у бота нет официального списка IP
Отдельного публичного диапазона адресов для ZanistaBot компания-разработчик не раскрывает. По независимым наблюдениям, запросы фиксировались с адресов в США, но опираться на единичный зафиксированный IP как на постоянный ориентир нельзя — инфраструктура облачных сервисов меняется. Для проверки конкретного случая полезно сопоставить IP с ASN и обратным DNS:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Если сеть, откуда приходит трафик, не имеет отношения к облачной инфраструктуре, которую можно связать с Zanista AI, — вероятно, кто-то просто подставил этот User-Agent, а не настоящий бот компании.
Блокировка через robots.txt
# Полная блокировка
User-agent: zanistabot
Disallow: /
# Точечное ограничение
User-agent: zanistabot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /
# Разрешить полностью
User-agent: zanistabot
Allow: /
Поскольку соблюдение robots.txt этим агентом не подтверждено наблюдениями, директиву стоит рассматривать как первый, но не единственный рубеж защиты.
Управление на уровне сервера
Nginx — жёсткая блокировка или мягкий rate-limit:
if ($http_user_agent ~* "zanistabot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=zanistabot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "zanistabot") {
limit_req zone=zanistabot burst=30 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} zanistabot [NC]
RewriteRule ^ - [F,L]
Управление через TrafficVeil
- Откройте список известных ботов в панели домена или в разделе
/system/bots. - Найдите
zanistabot/ZanistaBot. - Поставьте категорию «запретить» — как и другие агенты, собирающие контент для стороннего ИИ-продукта без ценности для самого сайта, он по умолчанию относится к нежелательным.
- При необходимости используйте массовые операции allow/deny без правки origin-сервера.
- Проверьте логи: запросы должны уходить в блок или лимит согласно выбранной политике.
Практические рекомендации
- Раз назначение бота — вероятный сбор контента для стороннего ИИ-сервиса, а не польза для посещаемого сайта, по умолчанию оправдан запрет или жёсткий rate-limit;
- Не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила по неймингу;
- Сначала измерьте долю запросов бота в логах или в аналитике TrafficVeil — при небольшом объёме резкий 403 не даст заметного эффекта на нагрузку, но полезен как гигиена доступа;
- Для всплесков вместо полного 403 обычно достаточно rate-limit, особенно если часть трафика может оказаться подделкой под этот User-Agent с других IP;
- Если бизнес-модель сайта строится на закрытии контента от сторонних ИИ-сборщиков (например, эксклюзивный аналитический материал), для ZanistaBot это дополнительный повод для полной блокировки, а не только rate-limit.
Похожие боты и сервисы для сравнения
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Итоговая стратегия
| Цель сайта | Рекомендация |
| Бот подтверждённо приносит пользу конкретному бизнесу (редкое исключение) | Точечно разрешить в TrafficVeil, зафиксировав причину |
| Бот не нужен и только грузит сервер (типичный случай для ZanistaBot) | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Нужно ограничить, но не блокировать полностью из-за риска спуфинга | Rate-limit вместо полной блокировки |
| Контент сайта эксклюзивен и не должен попадать в сторонние ИИ-продукты | Полная блокировка через /system/bots, без исключений |
Частые вопросы
Раз у ZanistaBot есть известный владелец, значит ли это, что он безопаснее анонимных ботов?
Что означает ссылка на «crawler-info» в строке User-Agent, если сама страница ничего не показывает?
Стоит ли ожидать, что ZanistaBot собирает контент именно для обучения языковых моделей?
Как отличить настоящий трафик ZanistaBot от подделки под этим именем?
Можно ли доверять robots.txt как единственному способу ограничить этого бота?
Есть ли смысл делать исключение для ZanistaBot, если сайт публикует финансовую аналитику?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.