Несмотря на общую формулировку в категории «Internet Archive / archiver», у этого конкретного бота есть куда более узкий и точный владелец: XY Planning Network — членская организация независимых финансовых консультантов, работающих по модели fee-only (комиссия только от клиента, без скрытых процентов от продажи продуктов). Официальная строка User-Agent прямо указывает на собственный домен архива организации — archive.xyplanningnetwork.com, а не на инфраструктуру archive.org.
Зачем финансовой ассоциации собственный архивный краулер
Ответ лежит в самом названии бота — «Compliance». Финансовые консультанты в США работают в жёстко регулируемой среде: регуляторы требуют вести записи о том, что именно консультант публично заявлял клиентам и потенциальным клиентам — на сайте, в рекламных материалах, в публичных заявлениях — на случай будущих проверок или споров. XY Planning Network, судя по названию и функции бота, ведёт архив таких публичных материалов не ради общекультурного сохранения веба (в отличие от Internet Archive), а как часть инфраструктуры регуляторного комплаенса для своих же членов — независимых консультантов, чьи сайты организация архивирует, чтобы у них было документальное подтверждение того, что было опубликовано и когда.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | Mozilla/5.0 (compatible; XY-Archive-Compliance-Archiver; +https://archive.xyplanningnetwork.com/); встречается и родственный токен XY-Archive-Compliance-Crawler |
| Оператор | XY Planning Network — членская организация fee-only финансовых консультантов (не Internet Archive) |
| Назначение | Архивирование веб-контента для целей регуляторного комплаенса и ведения записей в финансово-консультационной отрасли |
| Как сайт попадает в архив | Через обычные методы обнаружения в вебе либо потому, что сайт был напрямую подан в архивный сервис организации — вероятно, сайтами её членов-консультантов |
| Частота обхода | Регулярный каденс для построения хронологического архива изменений — типичное поведение для архивного краулера, но зависит от популярности и частоты обновления конкретного сайта |
| Официальный токен для robots.txt | По данным Cloudflare Radar, официально задокументированное правило блокировки использует укороченный токен: User-agent: XY-Archive-Compliance |
| Список IP-адресов | ❌ Отдельного официального фида не найдено |
Почему это меняет практическую оценку
Разница между «архивом для общекультурного сохранения» (как у Internet Archive) и «архивом для регуляторного комплаенса конкретной отраслевой ассоциации» существенна для решения о доступе. Если сайт не имеет отношения к финансовому консультированию и не является членом или клиентом XY Planning Network, присутствие этого бота в логах — вероятно, случайность обнаружения через обычный веб-краулинг, а не намеренный целевой архив, и прямой пользы владельцу сайта такое архивирование не несёт. Если же сайт принадлежит независимому финансовому консультанту, состоящему в этой ассоциации, — архивирование, вероятнее всего, часть той самой регуляторной инфраструктуры, ради которой консультант и является членом организации, и в этом случае блокировка может создать пробел в собственной документации consultant'а на случай будущей проверки.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
grep -i "xy-archive-compliance" /var/log/nginx/access.log
Стоит ли блокировать
Как и с другими веб-архивами в этой категории, здесь стоит учитывать особенность архивов в целом: контент может остаться в архиве даже после его удаления или изменения на самом сайте, а полный обход исторических разделов и документации может быть ощутимым по нагрузке. Дополнительно к этому:
- если сайт принадлежит консультанту-члену XY Planning Network — архивирование, вероятно, служит его же собственным интересам регуляторного комплаенса, и блокировка контрпродуктивна;
- если сайт никак не связан с этой отраслевой ассоциацией — прямой пользы от присутствия в её комплаенс-архиве нет, и блокировка обоснована;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — архивирование не связано с поисковой индексацией.
Как настроить robots.txt и сервер
Официально задокументированное правило блокировки, по данным Cloudflare Radar, использует укороченный токен:
User-agent: XY-Archive-Compliance
Disallow: /
Для более полного покрытия, учитывая встречающиеся варианты полного имени бота:
User-agent: XY-Archive-Compliance-Archiver
Disallow: /
User-agent: XY-Archive-Compliance-Crawler
Disallow: /
if ($http_user_agent ~* "XY-Archive-Compliance") {
return 403;
}
Если нагрузка полного обхода мешает, но полностью исключать сайт из архива нежелательно (например, для консультанта — члена ассоциации), альтернатива — ограничение частоты вместо жёсткого запрета:
limit_req_zone $binary_remote_addr zone=xyarchive:10m rate=10r/m;
location / {
if ($http_user_agent ~* "XY-Archive-Compliance") {
limit_req zone=xyarchive burst=20 nodelay;
}
}Частые вопросы
XY-Archive-Compliance-Archiver принадлежит Internet Archive?
Зачем финансовой ассоциации собственный архивный краулер?
Кому полезно присутствие в этом архиве?
Как правильно назвать токен в robots.txt?
Стоит ли блокировать бота, если сайт не связан с финансовым консультированием?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.