TrafficVeil
Боты 6 мин25 августа 2026 г.

SitemapBot: полный обход ради карты сайта

SitemapBot без единого именованного оператора, но с хорошо документированной функциональной категорией — краулерами для генерации XML-карты сайта, которым нужен полный обход каталога. Разбираем, почему это объясняет обход пагинации из черновика, и настройку блокировки через robots.txt и TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое SitemapBot на самом деле
  2. Зачем SitemapBot приходит на сайт
  3. Нагрузка и риски именно для SitemapBot
  4. Как найти SitemapBot в логах
  5. robots.txt для SitemapBot
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать SitemapBot
  11. Стратегия allow/deny для SitemapBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

SitemapBot — токен, для которого не нашлось единого именованного коммерческого оператора, но сама категория за ним хорошо документирована: это краулеры для автоматической генерации XML-карты сайта. Такие инструменты существуют и как коммерческие сервисы (например, Pro Sitemaps Generator с официально публикуемым списком IP), и как открытые библиотеки (npm-пакеты вроде sitemap-generator, sitemap-generator-cli), которые сайты и разработчики запускают самостоятельно, нередко используя общее имя бота вроде «SitemapBot» вместо уникального брендированного. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое SitemapBot на самом деле

Функция генератора карты сайта принципиально требует полного обхода: чтобы построить корректный XML sitemap, краулер должен пройти по всем страницам сайта, следуя ссылкам, и собрать их адреса, а часто и дополнительные метаданные (дату последнего изменения, приоритет). Это отличает такие боты от узкоспециализированных сервисных агентов, которые трогают одну-две страницы, — SitemapBot по своей природе стремится к полному покрытию каталога.

Открытые инструменты этой категории, такие как npm-пакет sitemap-generator, явно позволяют пользователю задать произвольную строку User-Agent через параметр командной строки, а также включить или отключить соблюдение robots.txt отдельным флагом (--no-respect-robots-txt). Это значит, что одно и то же имя бота может скрывать очень разное поведение — от вежливого, уважающего лимиты обхода, до агрессивного, полностью игнорирующего ограничения, — в зависимости от того, как конкретный оператор настроил свой экземпляр.

Параметр Значение
Название SitemapBot
User-Agent / паттерн sitemapbot
Оператор Не подтверждён публично под этим конкретным именем; функциональная категория — генераторы XML-карты сайта (коммерческие сервисы или самостоятельно запускаемые открытые инструменты)
Роль Полный обход сайта для построения XML sitemap — адреса страниц, иногда дата изменения и приоритет
Документация / ориентир Публичной документации именно для этого токена не обнаружено; опирайтесь на UA + поведение + ASN
Список IP ❌ Подтверждённого списка IP для этого конкретного UA не найдено; проверяйте ASN и не доверяйте только строке заголовка
robots.txt Зависит от конкретной реализации — открытые инструменты этой категории позволяют явно отключить соблюдение robots.txt, поэтому гарантий нет
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем SitemapBot приходит на сайт

Появление SitemapBot в access.log означает машинный доступ к сайту — не пользовательскую сессию. Логичное объяснение: кто-то (владелец сайта, разработчик, сторонний SEO-инструмент) генерирует карту сайта для этого домена — либо в рамках регулярного SEO-обслуживания, либо разово. Типичный кейс: ночью RPS растёт, конверсий нет — в access.log доминирует sitemapbot на пагинации и карточках, что полностью согласуется с задачей полного обхода каталога для построения sitemap.

Нагрузка и риски именно для SitemapBot

Отдельной строки в публичной сводке топ-ботов TrafficVeil у sitemapbot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Из-за самой природы задачи (полный обход) риск здесь выше, чем у узких сервисных ботов:

  • глубина обхода — полное покрытие каталога ожидаемо для этой категории, а не признак аномалии само по себе;
  • повторы одних и тех же URL при некорректной настройке краулера (например, зацикливание на параметрах пагинации);
  • отсутствие cookie и признаков сессии;
  • концентрация на служебных или, наоборот, самых «листовых» страницах.

Как найти SitemapBot в логах

Не ищите «просто ботов» — ищите конкретный токен sitemapbot и рядом смотрите соседей по семейству.

# Базовый поиск
grep -i "sitemapbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: подделать User-Agent может любой скрипт, а официального списка IP для этого токена нет. Для решения allow/deny смотрите связку UA + ASN/IP + частоту + набор URL — единовременный полный проход по каталогу, за которым следует долгая пауза, больше похож на легитимную разовую генерацию sitemap, чем на постоянный агрессивный обход:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для SitemapBot

# Жёсткий запрет
User-agent: sitemapbot
Disallow: /

# Разрешить всё
User-agent: sitemapbot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: sitemapbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: открытые инструменты этой категории могут быть явно настроены игнорировать robots.txt. Если агент продолжает обход после настройки правила, переходите к nginx/Apache или запрету в TrafficVeil.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "sitemapbot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=sitemapbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "sitemapbot") {
        limit_req zone=sitemapbot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} sitemapbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите sitemapbot / SitemapBot в ботах домена или в /system/bots;
  • прежде чем блокировать, уточните у команды, не генерируется ли карта сайта именно этим инструментом сейчас;
  • для нежелательного сценария — категория «запретить»; для мягкого (нужна разовая генерация, но частота избыточна) — rate-limit;
  • после изменения сверьте логи: хиты SitemapBot должны уйти в блок/лимит, а нужные поисковики остаться.

С кем не путать SitemapBot

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Стоит также отдельно проверить, не встречается ли на сайте похожий, но отдельно задокументированный бот Pro Sitemaps Generator — это другой, коммерческий инструмент той же функциональной категории с собственным официальным списком IP.

Стратегия allow/deny для SitemapBot

Ситуация Действие
Карту сайта генерирует ваша команда или подрядчик Allow + закрыть /admin /cart /api на время генерации
Источник обхода не подтверждён Disallow + запрет в TrafficVeil
Генерация легитимна, но нагрузка от полного обхода избыточна Rate-limit на nginx/TrafficVeil вместо полного запрета
Нежелательный по базе TrafficVeil, польза не подтверждена Deny по умолчанию, исключения — точечно
Подозрение на зацикливание краулера на параметрах пагинации Проверить топ URL — повторы одного и того же адреса с разными параметрами указывают на проблему в настройке краулера, а не на злонамеренность

Частые вопросы

Почему SitemapBot обходит весь каталог сайта, включая пагинацию?

Потому что построение корректной XML-карты сайта принципиально требует полного покрытия — краулер должен пройти по всем страницам, следуя ссылкам.

Есть ли единый коммерческий оператор, стоящий за именем SitemapBot?

Нет — под этим общим именем может скрываться как коммерческий сервис, так и самостоятельно запускаемый открытый инструмент вроде npm-пакета sitemap-generator.

Всегда ли такие боты соблюдают robots.txt?

Нет — открытые инструменты этой категории часто позволяют явно отключить соблюдение robots.txt отдельным параметром настройки.

Как отличить легитимную разовую генерацию sitemap от постоянного агрессивного обхода?

По паттерну: единовременный полный проход по каталогу с последующей долгой паузой типичен для генерации sitemap, в отличие от непрерывного повторяющегося обхода.

Что означают повторы одного и того же URL с разными параметрами в логах SitemapBot?

Это скорее указывает на проблему в настройке краулера — зацикливание на параметрах пагинации — а не на злонамеренность бота.

Стоит ли путать SitemapBot с коммерческим Pro Sitemaps Generator?

Нет — это отдельно задокументированный инструмент той же функциональной категории, но с собственным официальным списком IP, и его стоит проверять отдельно.

#SitemapBot#XML sitemap#боты на сайте#SEO-инструменты#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

SitemapBot: зачем ему полный обход каталога