SitemapBot — токен, для которого не нашлось единого именованного коммерческого оператора, но сама категория за ним хорошо документирована: это краулеры для автоматической генерации XML-карты сайта. Такие инструменты существуют и как коммерческие сервисы (например, Pro Sitemaps Generator с официально публикуемым списком IP), и как открытые библиотеки (npm-пакеты вроде sitemap-generator, sitemap-generator-cli), которые сайты и разработчики запускают самостоятельно, нередко используя общее имя бота вроде «SitemapBot» вместо уникального брендированного. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое SitemapBot на самом деле
Функция генератора карты сайта принципиально требует полного обхода: чтобы построить корректный XML sitemap, краулер должен пройти по всем страницам сайта, следуя ссылкам, и собрать их адреса, а часто и дополнительные метаданные (дату последнего изменения, приоритет). Это отличает такие боты от узкоспециализированных сервисных агентов, которые трогают одну-две страницы, — SitemapBot по своей природе стремится к полному покрытию каталога.
Открытые инструменты этой категории, такие как npm-пакет sitemap-generator, явно позволяют пользователю задать произвольную строку User-Agent через параметр командной строки, а также включить или отключить соблюдение robots.txt отдельным флагом (--no-respect-robots-txt). Это значит, что одно и то же имя бота может скрывать очень разное поведение — от вежливого, уважающего лимиты обхода, до агрессивного, полностью игнорирующего ограничения, — в зависимости от того, как конкретный оператор настроил свой экземпляр.
| Параметр | Значение |
| Название | SitemapBot |
| User-Agent / паттерн | sitemapbot |
| Оператор | Не подтверждён публично под этим конкретным именем; функциональная категория — генераторы XML-карты сайта (коммерческие сервисы или самостоятельно запускаемые открытые инструменты) |
| Роль | Полный обход сайта для построения XML sitemap — адреса страниц, иногда дата изменения и приоритет |
| Документация / ориентир | Публичной документации именно для этого токена не обнаружено; опирайтесь на UA + поведение + ASN |
| Список IP | ❌ Подтверждённого списка IP для этого конкретного UA не найдено; проверяйте ASN и не доверяйте только строке заголовка |
| robots.txt | Зависит от конкретной реализации — открытые инструменты этой категории позволяют явно отключить соблюдение robots.txt, поэтому гарантий нет |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем SitemapBot приходит на сайт
Появление SitemapBot в access.log означает машинный доступ к сайту — не пользовательскую сессию. Логичное объяснение: кто-то (владелец сайта, разработчик, сторонний SEO-инструмент) генерирует карту сайта для этого домена — либо в рамках регулярного SEO-обслуживания, либо разово. Типичный кейс: ночью RPS растёт, конверсий нет — в access.log доминирует sitemapbot на пагинации и карточках, что полностью согласуется с задачей полного обхода каталога для построения sitemap.
Нагрузка и риски именно для SitemapBot
Отдельной строки в публичной сводке топ-ботов TrafficVeil у sitemapbot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Из-за самой природы задачи (полный обход) риск здесь выше, чем у узких сервисных ботов:
- глубина обхода — полное покрытие каталога ожидаемо для этой категории, а не признак аномалии само по себе;
- повторы одних и тех же URL при некорректной настройке краулера (например, зацикливание на параметрах пагинации);
- отсутствие cookie и признаков сессии;
- концентрация на служебных или, наоборот, самых «листовых» страницах.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти SitemapBot в логах
Не ищите «просто ботов» — ищите конкретный токен sitemapbot и рядом смотрите соседей по семейству.
# Базовый поиск
grep -i "sitemapbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: подделать User-Agent может любой скрипт, а официального списка IP для этого токена нет. Для решения allow/deny смотрите связку UA + ASN/IP + частоту + набор URL — единовременный полный проход по каталогу, за которым следует долгая пауза, больше похож на легитимную разовую генерацию sitemap, чем на постоянный агрессивный обход:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt для SitemapBot
# Жёсткий запрет User-agent: sitemapbot Disallow: / # Разрешить всё User-agent: sitemapbot Allow: / # Компромисс: закрыть деньги/кабинет, оставить публичную часть User-agent: sitemapbot Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /api/ Allow: /
Важно: открытые инструменты этой категории могут быть явно настроены игнорировать robots.txt. Если агент продолжает обход после настройки правила, переходите к nginx/Apache или запрету в TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "sitemapbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=sitemapbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "sitemapbot") {
limit_req zone=sitemapbot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} sitemapbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- найдите sitemapbot / SitemapBot в ботах домена или в
/system/bots; - прежде чем блокировать, уточните у команды, не генерируется ли карта сайта именно этим инструментом сейчас;
- для нежелательного сценария — категория «запретить»; для мягкого (нужна разовая генерация, но частота избыточна) — rate-limit;
- после изменения сверьте логи: хиты SitemapBot должны уйти в блок/лимит, а нужные поисковики остаться.
С кем не путать SitemapBot
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Стоит также отдельно проверить, не встречается ли на сайте похожий, но отдельно задокументированный бот Pro Sitemaps Generator — это другой, коммерческий инструмент той же функциональной категории с собственным официальным списком IP.
Стратегия allow/deny для SitemapBot
| Ситуация | Действие |
| Карту сайта генерирует ваша команда или подрядчик | Allow + закрыть /admin /cart /api на время генерации |
| Источник обхода не подтверждён | Disallow + запрет в TrafficVeil |
| Генерация легитимна, но нагрузка от полного обхода избыточна | Rate-limit на nginx/TrafficVeil вместо полного запрета |
| Нежелательный по базе TrafficVeil, польза не подтверждена | Deny по умолчанию, исключения — точечно |
| Подозрение на зацикливание краулера на параметрах пагинации | Проверить топ URL — повторы одного и того же адреса с разными параметрами указывают на проблему в настройке краулера, а не на злонамеренность |
Частые вопросы
Почему SitemapBot обходит весь каталог сайта, включая пагинацию?
Есть ли единый коммерческий оператор, стоящий за именем SitemapBot?
Всегда ли такие боты соблюдают robots.txt?
Как отличить легитимную разовую генерацию sitemap от постоянного агрессивного обхода?
Что означают повторы одного и того же URL с разными параметрами в логах SitemapBot?
Стоит ли путать SitemapBot с коммерческим Pro Sitemaps Generator?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.