Боты7 мин чтения·21 августа 2026 г.

InternetArchiveBot: три сущности под одним именем

InternetArchiveBot в логах и разговорах путают сразу с тремя разными вещами — штатным краулером Wayback, ботом-редактором Википедии IABot и произвольным спуфингом под узнаваемое имя. Разбираемся, почему фактическая нагрузка от активности IABot чаще всего скрыта внутри archive.org_bot, и как отдельным вики-шаблоном redактор Wikipedia может остановить бота на конкретной статье, не трогая ваш robots.txt.

TVTrafficVeil TeamЭксперты по защите веб-трафика

InternetArchiveBot — имя, которое в логах и в разговорах путают сразу с тремя разными вещами: штатным краулером Wayback Machine (archive.org_bot), ботом-редактором Википедии IABot, который чинит битые ссылки в статьях, и произвольными сторонними UA со словом «InternetArchive», не имеющими отношения ни к тому, ни к другому. Прежде чем настраивать правило, стоит разобраться, какая из трёх сущностей реально стоит за конкретным запросом в вашем access.log.

1. Что такое InternetArchiveBot на самом деле

IABot (InternetArchiveBot) — продвинутый бот, который работает как сервис Internet Archive в партнёрстве с сообществом Wikimedia. Его задача — бороться с «гниением ссылок» (link rot) в источниках более чем 400 вики-проектов: он находит битые внешние ссылки в сносках статей, проверяет, действительно ли они мертвы (заявленная точность — ложноположительный результат около 0.1–0.2% случаев), и заменяет их архивной версией из Wayback Machine — либо уже существующей, либо запрашивает новую архивацию, если снимка ещё нет. Оригинальный разработчик — Cyberpower678, среди текущих мейнтейнеров также Harej и GreenC.

Из этого следует ключевое практическое разделение, которое подтверждает и упрощённую схему из вашего черновика: обычная проверка «жива ли ссылка» — это лёгкий технический запрос к вашему серверу; а вот сам процесс сохранения снимка страницы в Wayback Machine исторически выполняется инфраструктурой архивации Internet Archive (то есть тем же семейством, что и archive.org_bot), а не отдельным UA специально для IABot. Это значит, что нагрузка на origin от «активности IABot» на практике часто и есть activность archive.org_bot — тот случай, когда деление на три сущности в черновике верно методологически, но не всегда различимо по UA буквально.

Сущность Что это Что видит ваш origin-сервер
archive.org_bot Штатный краулер Wayback Machine / Archive-It (см. отдельную статью) Полноценный фетч страницы для создания или обновления архивного снимка
InternetArchiveBot (IABot) Бот-редактор Wikimedia, чинит битые ссылки в сносках статей на 400+ вики-проектах Проверку живости ссылки и, при необходимости, инициирование архивации — фактическую архивацию выполняет инфраструктура Wayback
Сторонний UA со словом «InternetArchive» Не связан ни с одним из вышеперечисленных официально Что угодно — требует отдельной верификации, доверять названию не стоит
Параметр Значение
Название InternetArchiveBot (IABot)
Оператор Internet Archive, в партнёрстве с сообществом Wikimedia
Роль Обнаружение и исправление битых ссылок в источниках статей Wikimedia-проектов, добавление архивных версий
Верификация настоящего Wayback-трафика rDNS на IP должен резолвиться в поддомен *.archive.org, затем forward-проверка того же имени должна вернуть тот же IP
robots.txt Доступ можно ограничить через правила по токену UA — в отличие от многих архивных ботов, здесь это признанный рабочий метод
Опция отказа на стороне Wikipedia Редакторы конкретной статьи могут добавить шаблон {{nobots|deny=InternetArchiveBot}} прямо в вики-разметку — это управляет поведением бота на стороне Wikimedia, а не на вашем сервере
Пометка TrafficVeil Легитимный / Веб-архивы

2. Зачем InternetArchiveBot приходит на сайт

  • ваш URL используется как источник в сноске одной или нескольких статей Wikimedia-проектов, и бот периодически перепроверяет, доступен ли он ещё;
  • ссылка помечена как потенциально мёртвая (например, тегом {{dead link}}) — бот заходит, чтобы подтвердить статус перед заменой на архивную версию;
  • кто-то из редакторов вручную запустил инструмент «Analyze a Page» для конкретной статьи, что тоже приводит к проверке всех ссылок на странице, включая вашу.

Типичный кейс: единичная, редкая проверка конкретного URL, который фигурирует в чьей-то вики-сноске — совершенно не похоже на системный обход каталога или блога. Если в логах фиксируется что-то похожее на полноценный краулинг многих страниц сайта под этим именем — вероятнее, речь о полноценном archive.org_bot, а не о самом IABot.

3. Нагрузка и риски

Отдельной строки для InternetArchiveBot в сводке ботов может не быть именно потому, что его фактический «вес» в логах чаще всего скрыт внутри активности archive.org_bot — смотрите объём именно по этому токену, если оцениваете совокупную нагрузку от экосистемы Internet Archive на сайт.

Прямого риска для контента практически нет: цель — сохранить доступность источника для читателей энциклопедии, а не republishing или скрытый сбор данных. Если сайт активно цитируется в Wikimedia-проектах, блокировка этого трафика может означать, что битые ссылки на ваш сайт в статьях со временем не будут заменяться архивными версиями — то есть постоянная, а не разовая потеря видимости в источниках.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти InternetArchiveBot в логах

# Единый поиск по всем трём связанным токенам
grep -iE "archive.org_bot|InternetArchive|ia_archiver|special_archiver" /var/log/nginx/access.log

# Топ URL
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность — ожидаемо эпизодическая, а не системный фон
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Настоящий трафик экосистемы Wayback/IABot должен подтверждаться обратным DNS в поддомен *.archive.org с последующей прямой проверкой того же имени:

host 
# Ожидаем что-то вида *.archive.org

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Любой UA, содержащий слово «InternetArchive», но не проходящий эту rDNS-проверку — повод отнестись к нему как к потенциальному спуфингу под узнаваемое, вызывающее доверие имя, а не как к настоящему боту экосистемы Internet Archive.

5. robots.txt

# Для контроля доступа Wayback-инфраструктуры
User-agent: archive.org_bot
Disallow: /

# Разрешить — рекомендуемый вариант, если сайт цитируется в Wikimedia-проектах
User-agent: archive.org_bot
Allow: /

Важно: если цель — остановить именно поведение IABot на конкретной статье Wikipedia (а не входящий трафик на ваш сервер), правильный инструмент — не robots.txt, а вики-шаблон {{nobots|deny=InternetArchiveBot}}, добавляемый редакторами прямо в разметку статьи.

6. Контроль на практике

  • если запрос успешно прошёл rDNS-проверку на *.archive.org — allow, это часть экосистемы, поддерживающей цитируемость вашего сайта в Wikimedia-проектах;
  • чужой UA со словом InternetArchive без подтверждения через rDNS — deny, не полагайтесь на одно только название;
  • не путайте блокировку InternetArchiveBot/archive.org_bot с ArchiveBot проекта ArchiveTeam — это независимый, отдельный от Internet Archive инструмент массового веб-архивирования с собственной логикой и сообществом, несмотря на созвучное название;
  • для оценки совокупной нагрузки смотрите объём именно по archive.org_bot, а не ищите отдельную строку статистики специально для IABot.

7. Что делать: короткий алгоритм

  • Разберите полный UA и сделайте rDNS, прежде чем принимать любое решение — это первый и обязательный шаг для всей этой группы ботов;
  • Подтверждённый *.archive.org — allow, если нет принципиальных возражений против архивирования и цитируемости в Wikimedia-проектах;
  • Не подтверждён rDNS — deny;
  • Хотите остановить поведение бота именно в контексте конкретной статьи Wikipedia — используйте вики-шаблон nobots, а не серверную блокировку;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать InternetArchiveBot

Бот / сосед Кластер Комментарий
archive.org_bot Веб-архивы Штатный краулер Wayback Machine и Archive-It — технически часто и есть источник фактической нагрузки от «активности IABot»
Archive-It Веб-архивы Отдельный клиентский подписочный сервис для организаций — см. отдельную статью с разбором реального UA archive.org_bot
ArchiveBot (ArchiveTeam) Веб-архивы (независимый оператор) Несмотря на созвучное название, не связан с Internet Archive официально — отдельный проект и сообщество
ia_archiver Веб-архивы (статус требует проверки) Исторически связан с Internet Archive, но по ряду источников позже перешёл к закрытому сервису Alexa — не путать напрямую

9. Стратегия allow/deny

Ситуация Действие
rDNS подтверждает *.archive.org, нет возражений Allow
rDNS не подтверждает происхождение Deny — вероятный спуфинг под узнаваемое имя
Нужно остановить активность именно на конкретной статье Wikipedia Вики-шаблон {{nobots|deny=InternetArchiveBot}}, не серверная блокировка
Сайт активно цитируется в Wikimedia-проектах Allow — блокировка со временем ухудшает состояние ссылок на ваш сайт в источниках статей
Встретили ArchiveBot (ArchiveTeam) и приняли за InternetArchiveBot Разобраться отдельно — это разные операторы, несмотря на похожее название

Частые вопросы

InternetArchiveBot и archive.org_bot — это одно и то же?
Не совсем: IABot — бот-редактор Wikipedia для починки битых ссылок, а фактическую архивацию страниц чаще выполняет отдельная инфраструктура Wayback под именем archive.org_bot.
Зачем IABot вообще заходит на мой сайт?
Потому что ваш URL используется как источник в сноске одной или нескольких статей Wikimedia-проектов, и бот проверяет, доступен ли он ещё.
Как остановить IABot именно на конкретной статье Wikipedia?
Через вики-шаблон {{nobots|deny=InternetArchiveBot}}, который добавляют сами редакторы в разметку статьи — это работает на стороне Wikipedia, а не через ваш robots.txt.
Как проверить, что запрос действительно от экосистемы Internet Archive?
Через обратный DNS — IP должен резолвиться в поддомен *.archive.org, с последующим подтверждением прямой проверкой того же имени.
Стоит ли блокировать этот трафик, если сайт цитируется в Wikipedia?
Обычно нет — блокировка со временем приводит к тому, что битые ссылки на ваш сайт в статьях перестают заменяться архивными версиями.
Чем ArchiveBot отличается от InternetArchiveBot?
Это независимый проект сообщества ArchiveTeam, не связанный официально с Internet Archive, несмотря на похожее звучание названия.
#InternetArchiveBot#IABot#archive.org_bot#Wikimedia#веб-архивы#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil
InternetArchiveBot: разбираемся в трёх разных ботах