Qwarrybot — ещё один случай, когда открытые источники не дают уверенного ответа «кто это». Токен встречается в публичных списках блокировки ботов на крупных сайтах (наряду с уже разобранными в этой энциклопедии Quantcastbot, panscient.com и другими), что подтверждает: это реально существующий и достаточно заметный краулер, раз владельцы известных ресурсов сочли нужным явно прописать его в своём robots.txt. Но отдельной документации, официального сайта оператора или чёткого описания назначения найти не удалось. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое Qwarrybot на самом деле
Прямого подтверждения от публичного оператора под этим именно названием не нашлось. Тот факт, что Qwarrybot фигурирует в списках robots.txt рядом с известными ad-tech и business intelligence краулерами (Quantcastbot — контроль качества рекламы, panscient.com — сбор бизнес-данных, parse.ly scraper — контент-аналитика), может указывать на схожую природу — коммерческий сбор данных о сайте в интересах какого-то B2B-сервиса. Но это предположение по компании, а не установленный факт, и приравнивать Qwarrybot к этой категории без прямого подтверждения было бы поспешно.
| Параметр | Значение |
| Название | Qwarrybot |
| User-Agent (токен/паттерн) | qwarrybot |
| Оператор | Не подтверждён публично; встречается в списках блокировки рядом с ad-tech/business-intelligence краулерами — возможная, но не доказанная схожая природа |
| Назначение | Судя по формату UA и компании в списках блокировки — вероятно автоматический сбор данных о сайте в коммерческих целях; не подтверждено официально |
| Список IP-адресов | ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA |
| Соблюдение robots.txt | Зависит от оператора; крупные сайты явно прописывают его в своих правилах блокировки, что может говорить о частичном соблюдении хотя бы некоторыми версиями бота |
| Используется для обучения моделей | Не задокументировано явно |
| Категория TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Как работает Qwarrybot
Идентифицируется в access.log по паттерну User-Agent qwarrybot. Выполняет автоматические HTTP(S)-запросы к публичным URL сайта. Без подтверждённого оператора точный ответ на «зачем» дать нельзя — практический путь: посмотреть, какие именно URL затрагивает бот на вашем конкретном домене, и сопоставить их с известными интеграциями или партнёрствами, а не полагаться на общую теорию.
Нагрузка на сервер
На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий. Даже при умеренной средней частоте на одном домене возможны локальные всплески, похожие на L7-нагрузку: много 200 OK без роста реальных сессий. Признаки проблемной активности:
- рост RPS без роста конверсий;
- обход пагинации/каталога;
- повторяющиеся запросы к тяжёлым страницам;
- давление на origin CPU и bandwidth.
Обнаружение в логах
# Все запросы
grep -i "qwarrybot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "qwarrybot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "qwarrybot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "qwarrybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация здесь особенно важна из-за отсутствия подтверждённого публичного оператора: смотрите связку UA + ASN/IP + частоту + набор URL, а не доверяйте одной строке заголовка.
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt
# Полная блокировка User-agent: qwarrybot Disallow: / # Точечное ограничение User-agent: qwarrybot Disallow: /admin/ Disallow: /cart/ Disallow: /account/ Allow: / # Разрешить полностью User-agent: qwarrybot Allow: /
Учитывайте: не все агенты строго соблюдают robots.txt, а без подтверждённого оператора гарантий здесь ещё меньше обычного. Для гарантированного контроля используйте серверные правила или TrafficVeil.
Управление на уровне сервера
Nginx
if ($http_user_agent ~* "qwarrybot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=qwarrybot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "qwarrybot") {
limit_req zone=qwarrybot burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} qwarrybot [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- откройте список известных ботов в панели домена или
/system/bots; - найдите qwarrybot / Qwarrybot;
- раз крупные сайты явно блокируют этот токен в своём robots.txt, а официального подтверждения пользы нет — запрет по умолчанию выглядит разумным выбором;
- при необходимости используйте массовые операции allow/deny без правки origin;
- проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
Рекомендации по оптимизации
- В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
- не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- для всплесков чаще достаточно rate-limit вместо полного 403;
- контент лучше отдавать server-side, если хотите контролируемую индексацию легитимными агентами.
Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
В открытых списках блокировки Qwarrybot также соседствует с уже разобранными в этой энциклопедии Quantcastbot и panscient.com — компания в такой таблице сама по себе ничего не доказывает, но косвенно подтверждает, что это заметный, известный веб-мастерам краулер.
Сводная таблица стратегии
| Цель сайта | Рекомендация |
| Бот полезен бизнесу (подтверждена конкретная интеграция) | Allow / разрешить в TrafficVeil |
| Бот не нужен и только грузит сервер | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Нужен доступ, но беспокоит частота | Rate-limit вместо полной блокировки |
| Нежелательный бот по базе TrafficVeil, оператор не подтверждён | Запретить в /system/bots и контролировать по логам |