Прежде чем настраивать правило для Archive-It, стоит проверить сам токен: по официальной документации службы поддержки Archive-It, реальный User-Agent краулера — archive.org_bot, а не буквально «archive-it», как в черновике. Это не просто техническая деталь: если фильтровать логи по неверному токену, можно не увидеть реальный трафик сервиса вовсе.
1. Что такое Archive-It на самом деле
Archive-It — платная подписочная услуга Internet Archive для организаций (библиотек, университетов, госорганов, музеев, некоммерческих организаций), которые сами настраивают тематические коллекции сайтов для долгосрочного архивирования — своих собственных или сторонних, представляющих исследовательский или архивный интерес. Если этот краулер посещает ваш сайт, это почти всегда значит, что какая-то конкретная организация-клиент Archive-It включила ваш домен в свою коллекцию — а не что Internet Archive в целом решил заархивировать именно вас.
Важно отличать Archive-It от общего краулинга Wayback Machine самим Internet Archive: в апреле 2017 года Internet Archive объявил, что в целом перестаёт полагаться на robots.txt для своего основного архивного краулинга. Archive-It как отдельный клиентский сервис, судя по актуальной (2025 года) документации поддержки, продолжает по умолчанию уважать robots.txt и Crawl-delay для своей «стандартной» технологии обхода — это разные продукты с разной политикой.
| Параметр | Значение |
| Название | Archive-It |
| Оператор | Internet Archive — сервис для организаций-клиентов, которые сами настраивают коллекции для архивирования |
| Реальный User-Agent | archive.org_bot — по прямому указанию официальной службы поддержки Archive-It (не «archive-it», как в черновике) |
| Кто инициирует обход | Конкретная организация-клиент, которая включила сайт в свою коллекцию — не Internet Archive «в целом» |
| robots.txt — «стандартная» технология | По умолчанию уважает все исключения robots.txt и Crawl-delay |
| robots.txt — технология Brozzler | Уважает большинство исключений, но по умолчанию игнорирует исключения на встроенных ресурсах (изображения, стили) и Crawl-delay |
| Возможность обхода правила клиентом | Если владельца сайта не удаётся связаться, клиент Archive-It может добавить правило «Ignore Robots.txt» для конкретной коллекции — то есть исключение в вашем файле не гарантированно остановит целенаправленный сбор |
| IP-диапазон | Официально не публикуется в открытом доступе, но доступен по запросу через тикет в поддержку Archive-It |
| Пометка TrafficVeil | Легитимный / Веб-архивы |
2. Зачем Archive-It приходит на сайт
- сайт включён в тематическую коллекцию конкретной организации-клиента Archive-It — для научных исследований, отраслевого мониторинга, документирования событий или compliance-целей;
- краулер сохраняет снимки страниц для долгосрочного хранения — по заявлению самой службы поддержки, «вежливо», то есть не должен создавать заметную нагрузку на производительность или безопасность сайта;
- частота повторных визитов определяется настройками конкретной коллекции клиента, а не единым расписанием Internet Archive.
Типичный кейс: сайт периодически посещается краулером с не всегда очевидной регулярностью — это может означать как разовый архивный снимок для конкретного исследовательского проекта, так и регулярный мониторинг в рамках длительной коллекции клиента (например, отслеживание изменений на сайтах госорганов или новостных ресурсов).
3. Нагрузка и риски
Полный обход сайта, как отмечено в черновике, может быть ощутимым по нагрузке — особенно если используется технология Brozzler, которая при рендеринге страницы подгружает и встроенные ресурсы (изображения, стили) даже вопреки исключениям в robots.txt для этих типов файлов.
Главный практический риск — необратимость архивирования: контент, once заснятый, может оставаться доступным в архиве даже после удаления или изменения на самом сайте, и это распространяется не только на текст, но и на визуальное оформление, если использовалась технология с полным рендерингом. Учитывая, что клиент Archive-It может обойти исключение в robots.txt при отсутствии ответа от владельца сайта, полагаться только на файл для защиты от архивирования не стоит.
4. Как найти Archive-It в логах
# Базовый поиск по официальному UA
grep -i "archive.org_bot" /var/log/nginx/access.log
# На всякий случай проверьте и буквальный токен из черновика — вдруг он тоже встречается в вашей конфигурации
grep -i "archive-it" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Строку UA подделать может любой скрипт. Официальный IP-диапазон Archive-It не публикуется открыто, но его можно запросить через тикет в службу поддержки Archive-It — это более надёжный путь, чем полагаться на общий ASN Internet Archive:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Archive-It
# Жёсткий запрет — по умолчанию должен сработать для "стандартной" технологии обхода
User-agent: archive.org_bot
Disallow: /
# Разрешить всё
User-agent: archive.org_bot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важная оговорка: правило сработает для «стандартной» технологии обхода Archive-It по умолчанию, но клиент сервиса может сознательно обойти его через собственные настройки коллекции, если сочтёт это необходимым и не сможет связаться с владельцем сайта. Для полной уверенности в исключении из архива правильный путь — прямой контакт с Internet Archive/Archive-It, а не только технический файл.
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "archive.org_bot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=archiveit:10m rate=10r/m;
location / {
if ($http_user_agent ~* "archive.org_bot") {
limit_req zone=archiveit burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} archive.org_bot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите archive.org_bot (и на всякий случай archive-it) в разделе ботов домена или в /system/bots;
- для нежелательного сценария — категория «запретить», но учитывайте, что технический запрет не отменяет уже сделанные архивные снимки;
- если контент уже полностью удалён из открытого доступа на сайте, но остаётся в архиве и это критично — обращайтесь напрямую в Internet Archive, а не только настраивайте техническую блокировку;
- после изменения сверьте логи: хиты archive.org_bot должны уйти в блок/лимит, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Ищите в логах правильный токен —
archive.org_bot, а не «archive-it», иначе рискуете не увидеть реальный трафик сервиса; - Полный обход создаёт заметную нагрузку — учитывайте, что технология Brozzler дополнительно подгружает встроенные ресурсы даже при частичных исключениях в robots.txt;
- Критично важно не допустить архивирования конкретного контента — не полагайтесь только на robots.txt, свяжитесь с Internet Archive напрямую;
- Нужен точный IP-диапазон для верификации — запросите его через тикет в поддержку Archive-It, а не полагайтесь на общий ASN;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать Archive-It
Важная поправка к таблице «соседей» из черновика: ia_archiver исторически был краулером Internet Archive, но по независимым источникам этот конкретный токен позже перешёл к сервису Alexa Internet (ныне закрытому Amazon в 2022 году) — что делает его текущий статус неоднозначным и требующим отдельной проверки, а не автоматического включения в один ряд с Archive-It и archive.org_bot.
| Бот / сосед | Кластер | UA | Комментарий |
| Heritrix | Веб-архивы | heritrix | легитимный, открытый краулер, на котором построена технология обхода многих архивных сервисов, включая частично Archive-It |
| ia_archiver | Веб-архивы (требует проверки) | ia_archiver | Исторически связан с Internet Archive, но по ряду источников позже перешёл к ныне закрытому сервису Alexa — статус неоднозначен, не путать напрямую с Archive-It |
| special_archiver | Веб-архивы | special_archiver | легитимный |
| bnf.fr_bot | Веб-архивы (с законодательным мандатом) | bnf.fr_bot | Похожая архивная миссия, но с законодательным мандатом конкретной страны — Archive-It работает на добровольной клиентской основе |
9. Стратегия allow/deny для Archive-It
| Ситуация | Действие |
| Нет возражений против архивирования | Allow + закрыть /admin /cart /api |
| Полный обход создаёт заметную нагрузку | Rate-limit, учитывая дополнительную нагрузку от встроенных ресурсов при технологии Brozzler |
| Критично важно исключить контент из архива | Технический Disallow + прямое обращение в Internet Archive, поскольку клиент сервиса технически может обойти файл |
| Нужна точная верификация IP | Запросить диапазон через тикет в поддержку Archive-It |
| Подозрение на spoofing UA | Проверять именно archive.org_bot, а не буквальный «archive-it»; смотреть IP/ASN |