TrafficVeil
Боты 5 мин14 августа 2026 г.

2017 год: когда Internet Archive публично отказался от robots.txt

Это не постепенный дрейф политики — Internet Archive официально объявил об отказе соблюдать robots.txt для Wayback Machine. Разбираем причину решения и почему ia_archiver сегодня уже не токен IA.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Параметры
  2. Почему IA отказался от robots.txt — и это не просто игнорирование правил
  3. Нагрузка
  4. Контроль
  5. robots.txt (формальный шаг, не гарантия)
  6. Стратегия
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

archive.org_bot — штатный краулер Internet Archive для снимков в Wayback Machine. Сохраняет публичные страницы для истории веба.

Не путать:

  • ArchiveBot (ArchiveTeam) — другой оператор и инструмент. По собственным словам создателей проекта: «мы не Internet Archive». ArchiveBot технически «понимает» robots.txt, но использует файл только для поиска дополнительных ссылок (например, sitemap) — самим директивам Disallow он не следует
  • Heritrix в логах — open-source ПО; чужой инстанс этой программы не равен Internet Archive
  • ia_archiver — старый токен, исторически связанный с IA, но сегодня, по независимым данным, принадлежит уже Alexa, а не Internet Archive. Включать его в правила «на всякий случай для IA» сейчас не имеет прежнего смысла

Параметры

Параметр Значение
UA содержит archive.org_bot (часто Mozilla/5.0 (compatible; archive.org_bot +http://archive.org/details/archive.org_bot))
Токен robots archive.org_bot
Верификация rDNS на *.archive.org (напр. crawl*.us.archive.org) + forward DNS
robots.txt С 2017 года Internet Archive официально и публично объявил об отказе соблюдать директивы robots.txt для обхода и показа Wayback Machine — это не постепенная эволюция политики, а прямо анонсированное решение. Для гарантированного результата нужна блокировка на сервере, а не только Disallow
Контакт info@archive.org — для запросов на исключение конкретных материалов или удаление уже сохранённых снимков

Почему IA отказался от robots.txt — и это не просто игнорирование правил

Официальная причина, изложенная директором Wayback Machine в 2017 году: правила, созданные для управления поисковыми краулерами, плохо подходят архивной миссии. Если сайт добавляет robots.txt сегодня (или домен переходит к спамеру, который выставляет общий запрет), это не должно задним числом «стирать» уже сохранённую историю страницы, которая была легитимной и общественно значимой в момент архивации. Именно злоупотребление robots.txt для скрытия исторических версий сайтов (в том числе доменными спекулянтами) стало прямым поводом для изменения политики.

Практическое следствие для вебмастера: рассчитывать на Disallow как на надёжный барьер для archive.org_bot больше нельзя. Полевые отчёты за разные годы подтверждают это на практике — блокировка через robots.txt действительно перестаёт срабатывать, и добиться результата можно только через серверную блокировку (.htaccess, конфигурация nginx/Apache) или прямой запрос на удаление контакту info@archive.org.

Нагрузка

По сводке TrafficVeil — порядка 2,7 тысячи запросов. Архивные краулы периодические и не связаны с посещаемостью сайта людьми, поэтому объём сам по себе не показатель проблемы.

Контроль

grep -i "archive.org_bot" /var/log/nginx/access.log
host 
# для настоящего IA ожидается *.archive.org, затем forward DNS

robots.txt (формальный шаг, не гарантия)

User-agent: archive.org_bot
Disallow: /

Пропишите это правило как формальный сигнал намерения, но не как единственную защиту — с 2017 года у Internet Archive нет обязательства его соблюдать для функций Wayback Machine.

Стратегия

  • Хотите историю сайта в Wayback — Allow (или точечный Disallow для приватных зон, понимая, что это скорее пожелание, чем гарантия)
  • Не хотите архивирования — Disallow как формальность, но для реального эффекта нужна блокировка на сервере по UA/IP после подтверждения через rDNS, либо прямой запрос на удаление уже сохранённых снимков через info@archive.org
  • Чужой Heritrix без rDNS на archive.org — это не Internet Archive; решение принимайте отдельно, часто deny
  • ArchiveBot (ArchiveTeam) с тем же успехом не остановить через robots.txt — они прямо не следуют Disallow-директивам по конструкции инструмента
  • Не полагайтесь на ia_archiver как на актуальный синоним archive.org_bot — сегодня это, по всей видимости, токен Alexa, а не Internet Archive

Частые вопросы

Правда ли, что Internet Archive официально отказался от robots.txt?

Да, это публично объявленное в 2017 году решение, а не постепенное изменение поведения — директор Wayback Machine прямо объяснил причину в блоге.

Почему Internet Archive решил игнорировать robots.txt?

Потому что правила, созданные для управления поисковыми краулерами, не должны задним числом стирать уже сохранённую историю страницы, а через robots.txt этим злоупотребляли, включая доменных спекулянтов.

Работает ли Disallow в robots.txt для блокировки archive.org_bot сегодня?

Формально можно прописать, но полагаться на это как на гарантию нельзя — с 2017 года у IA нет обязательства соблюдать эту директиву для функций Wayback Machine.

Кому принадлежит токен ia_archiver сегодня?

По независимым данным, сейчас это токен Alexa, а не Internet Archive — включать его в правила специально для IA больше не имеет прежнего смысла.

Следует ли ArchiveBot от ArchiveTeam правилам robots.txt?

Нет, инструмент использует файл только для поиска дополнительных ссылок вроде sitemap, а сами Disallow-директивы не соблюдает, и это не Internet Archive, а отдельный проект.

Как реально остановить архивирование сайта, если robots.txt не работает?

Через блокировку на уровне сервера по UA/IP после подтверждения через reverse DNS, либо прямым запросом на удаление уже сохранённых снимков на info@archive.org.

#archive.org_bot#Internet Archive#Wayback Machine#ArchiveBot#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.