TrafficVeil
Боты 6 мин25 августа 2026 г.

Qwarrybot: заметный, но неопознанный краулер

Qwarrybot — ещё один бот без подтверждённого публичного оператора, хотя встречается в списках блокировки крупных сайтов рядом с известными ad-tech-краулерами. Разбираем, почему решение здесь строится на проверке собственных логов, а не на готовой теории, и как настроить блокировку через robots.txt и TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое Qwarrybot на самом деле
  2. Как работает Qwarrybot
  3. Нагрузка на сервер
  4. Обнаружение в логах
  5. robots.txt
  6. Управление на уровне сервера
  7. Nginx
  8. Apache (.htaccess)
  9. Через TrafficVeil
  10. Рекомендации по оптимизации
  11. Сравнение с похожими ботами
  12. Сводная таблица стратегии
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Qwarrybot — ещё один случай, когда открытые источники не дают уверенного ответа «кто это». Токен встречается в публичных списках блокировки ботов на крупных сайтах (наряду с уже разобранными в этой энциклопедии Quantcastbot, panscient.com и другими), что подтверждает: это реально существующий и достаточно заметный краулер, раз владельцы известных ресурсов сочли нужным явно прописать его в своём robots.txt. Но отдельной документации, официального сайта оператора или чёткого описания назначения найти не удалось. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое Qwarrybot на самом деле

Прямого подтверждения от публичного оператора под этим именно названием не нашлось. Тот факт, что Qwarrybot фигурирует в списках robots.txt рядом с известными ad-tech и business intelligence краулерами (Quantcastbot — контроль качества рекламы, panscient.com — сбор бизнес-данных, parse.ly scraper — контент-аналитика), может указывать на схожую природу — коммерческий сбор данных о сайте в интересах какого-то B2B-сервиса. Но это предположение по компании, а не установленный факт, и приравнивать Qwarrybot к этой категории без прямого подтверждения было бы поспешно.

Параметр Значение
Название Qwarrybot
User-Agent (токен/паттерн) qwarrybot
Оператор Не подтверждён публично; встречается в списках блокировки рядом с ad-tech/business-intelligence краулерами — возможная, но не доказанная схожая природа
Назначение Судя по формату UA и компании в списках блокировки — вероятно автоматический сбор данных о сайте в коммерческих целях; не подтверждено официально
Список IP-адресов ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA
Соблюдение robots.txt Зависит от оператора; крупные сайты явно прописывают его в своих правилах блокировки, что может говорить о частичном соблюдении хотя бы некоторыми версиями бота
Используется для обучения моделей Не задокументировано явно
Категория TrafficVeil Нежелательный / Прочие краулеры и сервисы

Как работает Qwarrybot

Идентифицируется в access.log по паттерну User-Agent qwarrybot. Выполняет автоматические HTTP(S)-запросы к публичным URL сайта. Без подтверждённого оператора точный ответ на «зачем» дать нельзя — практический путь: посмотреть, какие именно URL затрагивает бот на вашем конкретном домене, и сопоставить их с известными интеграциями или партнёрствами, а не полагаться на общую теорию.

Нагрузка на сервер

На отдельных доменах поведение может выглядеть как волна автоматических запросов без пользовательских сессий. Даже при умеренной средней частоте на одном домене возможны локальные всплески, похожие на L7-нагрузку: много 200 OK без роста реальных сессий. Признаки проблемной активности:

  • рост RPS без роста конверсий;
  • обход пагинации/каталога;
  • повторяющиеся запросы к тяжёлым страницам;
  • давление на origin CPU и bandwidth.

Обнаружение в логах

# Все запросы
grep -i "qwarrybot" /var/log/nginx/access.log

# Количество запросов за сегодня
grep -i "qwarrybot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP
grep -i "qwarrybot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Частота по дням
grep -i "qwarrybot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация здесь особенно важна из-за отсутствия подтверждённого публичного оператора: смотрите связку UA + ASN/IP + частоту + набор URL, а не доверяйте одной строке заголовка.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt

# Полная блокировка
User-agent: qwarrybot
Disallow: /

# Точечное ограничение
User-agent: qwarrybot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /

# Разрешить полностью
User-agent: qwarrybot
Allow: /

Учитывайте: не все агенты строго соблюдают robots.txt, а без подтверждённого оператора гарантий здесь ещё меньше обычного. Для гарантированного контроля используйте серверные правила или TrafficVeil.

Управление на уровне сервера

Nginx

if ($http_user_agent ~* "qwarrybot") {
    return 403;
}

# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=qwarrybot:10m rate=15r/m;

location / {
    if ($http_user_agent ~* "qwarrybot") {
        limit_req zone=qwarrybot burst=30 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} qwarrybot [NC]
RewriteRule ^ - [F,L]

Через TrafficVeil

  • откройте список известных ботов в панели домена или /system/bots;
  • найдите qwarrybot / Qwarrybot;
  • раз крупные сайты явно блокируют этот токен в своём robots.txt, а официального подтверждения пользы нет — запрет по умолчанию выглядит разумным выбором;
  • при необходимости используйте массовые операции allow/deny без правки origin;
  • проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.

Рекомендации по оптимизации

  • В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
  • не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
  • сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
  • для всплесков чаще достаточно rate-limit вместо полного 403;
  • контент лучше отдавать server-side, если хотите контролируемую индексацию легитимными агентами.

Сравнение с похожими ботами

Бот Кластер User-Agent Метка
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

В открытых списках блокировки Qwarrybot также соседствует с уже разобранными в этой энциклопедии Quantcastbot и panscient.com — компания в такой таблице сама по себе ничего не доказывает, но косвенно подтверждает, что это заметный, известный веб-мастерам краулер.

Сводная таблица стратегии

Цель сайта Рекомендация
Бот полезен бизнесу (подтверждена конкретная интеграция) Allow / разрешить в TrafficVeil
Бот не нужен и только грузит сервер Disallow + запрет в TrafficVeil или 403 на nginx/Apache
Нужен доступ, но беспокоит частота Rate-limit вместо полной блокировки
Нежелательный бот по базе TrafficVeil, оператор не подтверждён Запретить в /system/bots и контролировать по логам

Частые вопросы

Удалось ли найти официального оператора или сайт компании, стоящей за Qwarrybot?

Нет — отдельной документации или официального ресурса оператора обнаружить не удалось, несмотря на поиск.

Что говорит присутствие Qwarrybot в списках блокировки крупных сайтов?

Это подтверждает, что бот реально существует и достаточно заметен — раз владельцы известных ресурсов сочли нужным явно прописать его в своём robots.txt.

Можно ли считать Qwarrybot тем же типом бота, что Quantcastbot или panscient.com, раз они соседствуют в списках?

Нет оснований — соседство в таблице блокировки ничего не доказывает о самой природе бота, это лишь косвенное наблюдение.

Какая стратегия разумна по умолчанию для необъяснённого бота вроде Qwarrybot?

Запрет, учитывая отсутствие подтверждённой пользы и присутствие в списках блокировки других сайтов.

Как лучше всего разобраться с этим ботом на конкретном домене?

Проверить, какие именно URL он запрашивает, и сопоставить их с известными интеграциями сайта, а не полагаться на общую теорию.

Можно ли доверять robots.txt для контроля Qwarrybot?

Гарантий нет — без подтверждённого оператора надёжность файла ниже обычного, поэтому стоит дублировать контроль на уровне сервера или TrafficVeil.

#Qwarrybot#боты на сайте#robots.txt#верификация#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Qwarrybot: как реагировать без данных об операторе