SitemapBot — токен, для которого не нашлось единого именованного коммерческого оператора, но сама категория за ним хорошо документирована: это краулеры для автоматической генерации XML-карты сайта. Такие инструменты существуют и как коммерческие сервисы (например, Pro Sitemaps Generator с официально публикуемым списком IP), и как открытые библиотеки (npm-пакеты вроде sitemap-generator, sitemap-generator-cli), которые сайты и разработчики запускают самостоятельно, нередко используя общее имя бота вроде «SitemapBot» вместо уникального брендированного. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое SitemapBot на самом деле
Функция генератора карты сайта принципиально требует полного обхода: чтобы построить корректный XML sitemap, краулер должен пройти по всем страницам сайта, следуя ссылкам, и собрать их адреса, а часто и дополнительные метаданные (дату последнего изменения, приоритет). Это отличает такие боты от узкоспециализированных сервисных агентов, которые трогают одну-две страницы, — SitemapBot по своей природе стремится к полному покрытию каталога.
Открытые инструменты этой категории, такие как npm-пакет sitemap-generator, явно позволяют пользователю задать произвольную строку User-Agent через параметр командной строки, а также включить или отключить соблюдение robots.txt отдельным флагом (--no-respect-robots-txt). Это значит, что одно и то же имя бота может скрывать очень разное поведение — от вежливого, уважающего лимиты обхода, до агрессивного, полностью игнорирующего ограничения, — в зависимости от того, как конкретный оператор настроил свой экземпляр.
| Параметр | Значение |
| Название | SitemapBot |
| User-Agent / паттерн | sitemapbot |
| Оператор | Не подтверждён публично под этим конкретным именем; функциональная категория — генераторы XML-карты сайта (коммерческие сервисы или самостоятельно запускаемые открытые инструменты) |
| Роль | Полный обход сайта для построения XML sitemap — адреса страниц, иногда дата изменения и приоритет |
| Документация / ориентир | Публичной документации именно для этого токена не обнаружено; опирайтесь на UA + поведение + ASN |
| Список IP | ❌ Подтверждённого списка IP для этого конкретного UA не найдено; проверяйте ASN и не доверяйте только строке заголовка |
| robots.txt | Зависит от конкретной реализации — открытые инструменты этой категории позволяют явно отключить соблюдение robots.txt, поэтому гарантий нет |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем SitemapBot приходит на сайт
Появление SitemapBot в access.log означает машинный доступ к сайту — не пользовательскую сессию. Логичное объяснение: кто-то (владелец сайта, разработчик, сторонний SEO-инструмент) генерирует карту сайта для этого домена — либо в рамках регулярного SEO-обслуживания, либо разово. Типичный кейс: ночью RPS растёт, конверсий нет — в access.log доминирует sitemapbot на пагинации и карточках, что полностью согласуется с задачей полного обхода каталога для построения sitemap.
Нагрузка и риски именно для SitemapBot
Отдельной строки в публичной сводке топ-ботов TrafficVeil у sitemapbot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Из-за самой природы задачи (полный обход) риск здесь выше, чем у узких сервисных ботов:
- глубина обхода — полное покрытие каталога ожидаемо для этой категории, а не признак аномалии само по себе;
- повторы одних и тех же URL при некорректной настройке краулера (например, зацикливание на параметрах пагинации);
- отсутствие cookie и признаков сессии;
- концентрация на служебных или, наоборот, самых «листовых» страницах.
Как найти SitemapBot в логах
Не ищите «просто ботов» — ищите конкретный токен sitemapbot и рядом смотрите соседей по семейству.
# Базовый поиск
grep -i "sitemapbot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "sitemapbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: подделать User-Agent может любой скрипт, а официального списка IP для этого токена нет. Для решения allow/deny смотрите связку UA + ASN/IP + частоту + набор URL — единовременный полный проход по каталогу, за которым следует долгая пауза, больше похож на легитимную разовую генерацию sitemap, чем на постоянный агрессивный обход:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt для SitemapBot
# Жёсткий запрет User-agent: sitemapbot Disallow: / # Разрешить всё User-agent: sitemapbot Allow: / # Компромисс: закрыть деньги/кабинет, оставить публичную часть User-agent: sitemapbot Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /api/ Allow: /
Важно: открытые инструменты этой категории могут быть явно настроены игнорировать robots.txt. Если агент продолжает обход после настройки правила, переходите к nginx/Apache или запрету в TrafficVeil.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "sitemapbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=sitemapbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "sitemapbot") {
limit_req zone=sitemapbot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} sitemapbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- найдите sitemapbot / SitemapBot в ботах домена или в
/system/bots; - прежде чем блокировать, уточните у команды, не генерируется ли карта сайта именно этим инструментом сейчас;
- для нежелательного сценария — категория «запретить»; для мягкого (нужна разовая генерация, но частота избыточна) — rate-limit;
- после изменения сверьте логи: хиты SitemapBot должны уйти в блок/лимит, а нужные поисковики остаться.
С кем не путать SitemapBot
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Стоит также отдельно проверить, не встречается ли на сайте похожий, но отдельно задокументированный бот Pro Sitemaps Generator — это другой, коммерческий инструмент той же функциональной категории с собственным официальным списком IP.
Стратегия allow/deny для SitemapBot
| Ситуация | Действие |
| Карту сайта генерирует ваша команда или подрядчик | Allow + закрыть /admin /cart /api на время генерации |
| Источник обхода не подтверждён | Disallow + запрет в TrafficVeil |
| Генерация легитимна, но нагрузка от полного обхода избыточна | Rate-limit на nginx/TrafficVeil вместо полного запрета |
| Нежелательный по базе TrafficVeil, польза не подтверждена | Deny по умолчанию, исключения — точечно |
| Подозрение на зацикливание краулера на параметрах пагинации | Проверить топ URL — повторы одного и того же адреса с разными параметрами указывают на проблему в настройке краулера, а не на злонамеренность |