Боты5 мин чтения·14 августа 2026 г.·обновлено 8 сентября 2026 г.

2017 год: когда Internet Archive публично отказался от robots.txt

Это не постепенный дрейф политики — Internet Archive официально объявил об отказе соблюдать robots.txt для Wayback Machine. Разбираем причину решения и почему ia_archiver сегодня уже не токен IA.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота archive.org_bot: легитимный веб-архивы

archive.org_bot — штатный краулер Internet Archive для снимков в Wayback Machine. Сохраняет публичные страницы для истории веба.

Не путать:

  • ArchiveBot (ArchiveTeam) — другой оператор и инструмент. По собственным словам создателей проекта: «мы не Internet Archive». ArchiveBot технически «понимает» robots.txt, но использует файл только для поиска дополнительных ссылок (например, sitemap) — самим директивам Disallow он не следует
  • Heritrix в логах — open-source ПО; чужой инстанс этой программы не равен Internet Archive
  • ia_archiver — старый токен, исторически связанный с IA, но сегодня, по независимым данным, принадлежит уже Alexa, а не Internet Archive. Включать его в правила «на всякий случай для IA» сейчас не имеет прежнего смысла

Параметры

Параметр Значение
UA содержит archive.org_bot (часто Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot))
Токен robots archive.org_bot
Верификация rDNS на *.archive.org (напр. crawl*.us.archive.org) + forward DNS
robots.txt С 2017 года Internet Archive официально и публично объявил об отказе соблюдать директивы robots.txt для обхода и показа Wayback Machine — это не постепенная эволюция политики, а прямо анонсированное решение. Для гарантированного результата нужна блокировка на сервере, а не только Disallow
Контакт info@archive.org — для запросов на исключение конкретных материалов или удаление уже сохранённых снимков

Почему IA отказался от robots.txt — и это не просто игнорирование правил

Официальная причина, изложенная директором Wayback Machine в 2017 году: правила, созданные для управления поисковыми краулерами, плохо подходят архивной миссии. Если сайт добавляет robots.txt сегодня (или домен переходит к спамеру, который выставляет общий запрет), это не должно задним числом «стирать» уже сохранённую историю страницы, которая была легитимной и общественно значимой в момент архивации. Именно злоупотребление robots.txt для скрытия исторических версий сайтов (в том числе доменными спекулянтами) стало прямым поводом для изменения политики.

Практическое следствие для вебмастера: рассчитывать на Disallow как на надёжный барьер для archive.org_bot больше нельзя. Полевые отчёты за разные годы подтверждают это на практике — блокировка через robots.txt действительно перестаёт срабатывать, и добиться результата можно только через серверную блокировку (.htaccess, конфигурация nginx/Apache) или прямой запрос на удаление контакту info@archive.org.

Нагрузка

По сводке TrafficVeil — порядка 2,7 тысячи запросов. Архивные краулы периодические и не связаны с посещаемостью сайта людьми, поэтому объём сам по себе не показатель проблемы.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Контроль

grep -i "archive.org_bot" /var/log/nginx/access.log
host 
# для настоящего IA ожидается *.archive.org, затем forward DNS

robots.txt (формальный шаг, не гарантия)

User-agent: archive.org_bot
Disallow: /

Пропишите это правило как формальный сигнал намерения, но не как единственную защиту — с 2017 года у Internet Archive нет обязательства его соблюдать для функций Wayback Machine.

Стратегия

  • Хотите историю сайта в Wayback — Allow (или точечный Disallow для приватных зон, понимая, что это скорее пожелание, чем гарантия)
  • Не хотите архивирования — Disallow как формальность, но для реального эффекта нужна блокировка на сервере по UA/IP после подтверждения через rDNS, либо прямой запрос на удаление уже сохранённых снимков через info@archive.org
  • Чужой Heritrix без rDNS на archive.org — это не Internet Archive; решение принимайте отдельно, часто deny
  • ArchiveBot (ArchiveTeam) с тем же успехом не остановить через robots.txt — они прямо не следуют Disallow-директивам по конструкции инструмента
  • Не полагайтесь на ia_archiver как на актуальный синоним archive.org_bot — сегодня это, по всей видимости, токен Alexa, а не Internet Archive

Частые вопросы

Правда ли, что Internet Archive официально отказался от robots.txt?
Да, это публично объявленное в 2017 году решение, а не постепенное изменение поведения — директор Wayback Machine прямо объяснил причину в блоге.
Почему Internet Archive решил игнорировать robots.txt?
Потому что правила, созданные для управления поисковыми краулерами, не должны задним числом стирать уже сохранённую историю страницы, а через robots.txt этим злоупотребляли, включая доменных спекулянтов.
Работает ли Disallow в robots.txt для блокировки archive.org_bot сегодня?
Формально можно прописать, но полагаться на это как на гарантию нельзя — с 2017 года у IA нет обязательства соблюдать эту директиву для функций Wayback Machine.
Кому принадлежит токен ia_archiver сегодня?
По независимым данным, сейчас это токен Alexa, а не Internet Archive — включать его в правила специально для IA больше не имеет прежнего смысла.
Следует ли ArchiveBot от ArchiveTeam правилам robots.txt?
Нет, инструмент использует файл только для поиска дополнительных ссылок вроде sitemap, а сами Disallow-директивы не соблюдает, и это не Internet Archive, а отдельный проект.
Как реально остановить архивирование сайта, если robots.txt не работает?
Через блокировку на уровне сервера по UA/IP после подтверждения через reverse DNS, либо прямым запросом на удаление уже сохранённых снимков на info@archive.org.
#archive.org_bot#Internet Archive#Wayback Machine#ArchiveBot#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil