archive.org_bot — штатный краулер Internet Archive для снимков в Wayback Machine. Сохраняет публичные страницы для истории веба.
Не путать:
- ArchiveBot (ArchiveTeam) — другой оператор и инструмент. По собственным словам создателей проекта: «мы не Internet Archive». ArchiveBot технически «понимает» robots.txt, но использует файл только для поиска дополнительных ссылок (например, sitemap) — самим директивам Disallow он не следует
- Heritrix в логах — open-source ПО; чужой инстанс этой программы не равен Internet Archive
- ia_archiver — старый токен, исторически связанный с IA, но сегодня, по независимым данным, принадлежит уже Alexa, а не Internet Archive. Включать его в правила «на всякий случай для IA» сейчас не имеет прежнего смысла
Параметры
| Параметр | Значение |
|---|---|
| UA | содержит archive.org_bot (часто Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot)) |
| Токен robots | archive.org_bot |
| Верификация | rDNS на *.archive.org (напр. crawl*.us.archive.org) + forward DNS |
| robots.txt | С 2017 года Internet Archive официально и публично объявил об отказе соблюдать директивы robots.txt для обхода и показа Wayback Machine — это не постепенная эволюция политики, а прямо анонсированное решение. Для гарантированного результата нужна блокировка на сервере, а не только Disallow |
| Контакт | info@archive.org — для запросов на исключение конкретных материалов или удаление уже сохранённых снимков |
Почему IA отказался от robots.txt — и это не просто игнорирование правил
Официальная причина, изложенная директором Wayback Machine в 2017 году: правила, созданные для управления поисковыми краулерами, плохо подходят архивной миссии. Если сайт добавляет robots.txt сегодня (или домен переходит к спамеру, который выставляет общий запрет), это не должно задним числом «стирать» уже сохранённую историю страницы, которая была легитимной и общественно значимой в момент архивации. Именно злоупотребление robots.txt для скрытия исторических версий сайтов (в том числе доменными спекулянтами) стало прямым поводом для изменения политики.
Практическое следствие для вебмастера: рассчитывать на Disallow как на надёжный барьер для archive.org_bot больше нельзя. Полевые отчёты за разные годы подтверждают это на практике — блокировка через robots.txt действительно перестаёт срабатывать, и добиться результата можно только через серверную блокировку (.htaccess, конфигурация nginx/Apache) или прямой запрос на удаление контакту info@archive.org.
Нагрузка
По сводке TrafficVeil — порядка 2,7 тысячи запросов. Архивные краулы периодические и не связаны с посещаемостью сайта людьми, поэтому объём сам по себе не показатель проблемы.
Контроль
grep -i "archive.org_bot" /var/log/nginx/access.log
host
# для настоящего IA ожидается *.archive.org, затем forward DNS
robots.txt (формальный шаг, не гарантия)
User-agent: archive.org_bot
Disallow: /
Пропишите это правило как формальный сигнал намерения, но не как единственную защиту — с 2017 года у Internet Archive нет обязательства его соблюдать для функций Wayback Machine.
Стратегия
- Хотите историю сайта в Wayback — Allow (или точечный Disallow для приватных зон, понимая, что это скорее пожелание, чем гарантия)
- Не хотите архивирования — Disallow как формальность, но для реального эффекта нужна блокировка на сервере по UA/IP после подтверждения через rDNS, либо прямой запрос на удаление уже сохранённых снимков через info@archive.org
- Чужой Heritrix без rDNS на archive.org — это не Internet Archive; решение принимайте отдельно, часто deny
- ArchiveBot (ArchiveTeam) с тем же успехом не остановить через robots.txt — они прямо не следуют Disallow-директивам по конструкции инструмента
- Не полагайтесь на ia_archiver как на актуальный синоним archive.org_bot — сегодня это, по всей видимости, токен Alexa, а не Internet Archive