InternetArchiveBot — имя, которое в логах и в разговорах путают сразу с тремя разными вещами: штатным краулером Wayback Machine (archive.org_bot), ботом-редактором Википедии IABot, который чинит битые ссылки в статьях, и произвольными сторонними UA со словом «InternetArchive», не имеющими отношения ни к тому, ни к другому. Прежде чем настраивать правило, стоит разобраться, какая из трёх сущностей реально стоит за конкретным запросом в вашем access.log.
1. Что такое InternetArchiveBot на самом деле
IABot (InternetArchiveBot) — продвинутый бот, который работает как сервис Internet Archive в партнёрстве с сообществом Wikimedia. Его задача — бороться с «гниением ссылок» (link rot) в источниках более чем 400 вики-проектов: он находит битые внешние ссылки в сносках статей, проверяет, действительно ли они мертвы (заявленная точность — ложноположительный результат около 0.1–0.2% случаев), и заменяет их архивной версией из Wayback Machine — либо уже существующей, либо запрашивает новую архивацию, если снимка ещё нет. Оригинальный разработчик — Cyberpower678, среди текущих мейнтейнеров также Harej и GreenC.
Из этого следует ключевое практическое разделение, которое подтверждает и упрощённую схему из вашего черновика: обычная проверка «жива ли ссылка» — это лёгкий технический запрос к вашему серверу; а вот сам процесс сохранения снимка страницы в Wayback Machine исторически выполняется инфраструктурой архивации Internet Archive (то есть тем же семейством, что и archive.org_bot), а не отдельным UA специально для IABot. Это значит, что нагрузка на origin от «активности IABot» на практике часто и есть activность archive.org_bot — тот случай, когда деление на три сущности в черновике верно методологически, но не всегда различимо по UA буквально.
| Сущность | Что это | Что видит ваш origin-сервер |
| archive.org_bot | Штатный краулер Wayback Machine / Archive-It (см. отдельную статью) | Полноценный фетч страницы для создания или обновления архивного снимка |
| InternetArchiveBot (IABot) | Бот-редактор Wikimedia, чинит битые ссылки в сносках статей на 400+ вики-проектах | Проверку живости ссылки и, при необходимости, инициирование архивации — фактическую архивацию выполняет инфраструктура Wayback |
| Сторонний UA со словом «InternetArchive» | Не связан ни с одним из вышеперечисленных официально | Что угодно — требует отдельной верификации, доверять названию не стоит |
| Параметр | Значение |
| Название | InternetArchiveBot (IABot) |
| Оператор | Internet Archive, в партнёрстве с сообществом Wikimedia |
| Роль | Обнаружение и исправление битых ссылок в источниках статей Wikimedia-проектов, добавление архивных версий |
| Верификация настоящего Wayback-трафика | rDNS на IP должен резолвиться в поддомен *.archive.org, затем forward-проверка того же имени должна вернуть тот же IP |
| robots.txt | Доступ можно ограничить через правила по токену UA — в отличие от многих архивных ботов, здесь это признанный рабочий метод |
| Опция отказа на стороне Wikipedia | Редакторы конкретной статьи могут добавить шаблон {{nobots|deny=InternetArchiveBot}} прямо в вики-разметку — это управляет поведением бота на стороне Wikimedia, а не на вашем сервере |
| Пометка TrafficVeil | Легитимный / Веб-архивы |
2. Зачем InternetArchiveBot приходит на сайт
- ваш URL используется как источник в сноске одной или нескольких статей Wikimedia-проектов, и бот периодически перепроверяет, доступен ли он ещё;
- ссылка помечена как потенциально мёртвая (например, тегом
{{dead link}}) — бот заходит, чтобы подтвердить статус перед заменой на архивную версию; - кто-то из редакторов вручную запустил инструмент «Analyze a Page» для конкретной статьи, что тоже приводит к проверке всех ссылок на странице, включая вашу.
Типичный кейс: единичная, редкая проверка конкретного URL, который фигурирует в чьей-то вики-сноске — совершенно не похоже на системный обход каталога или блога. Если в логах фиксируется что-то похожее на полноценный краулинг многих страниц сайта под этим именем — вероятнее, речь о полноценном archive.org_bot, а не о самом IABot.
3. Нагрузка и риски
Отдельной строки для InternetArchiveBot в сводке ботов может не быть именно потому, что его фактический «вес» в логах чаще всего скрыт внутри активности archive.org_bot — смотрите объём именно по этому токену, если оцениваете совокупную нагрузку от экосистемы Internet Archive на сайт.
Прямого риска для контента практически нет: цель — сохранить доступность источника для читателей энциклопедии, а не republishing или скрытый сбор данных. Если сайт активно цитируется в Wikimedia-проектах, блокировка этого трафика может означать, что битые ссылки на ваш сайт в статьях со временем не будут заменяться архивными версиями — то есть постоянная, а не разовая потеря видимости в источниках.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти InternetArchiveBot в логах
# Единый поиск по всем трём связанным токенам
grep -iE "archive.org_bot|InternetArchive|ia_archiver|special_archiver" /var/log/nginx/access.log
# Топ URL
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — ожидаемо эпизодическая, а не системный фон
grep -iE "archive.org_bot|InternetArchive" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Настоящий трафик экосистемы Wayback/IABot должен подтверждаться обратным DNS в поддомен *.archive.org с последующей прямой проверкой того же имени:
host
# Ожидаем что-то вида *.archive.org
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Любой UA, содержащий слово «InternetArchive», но не проходящий эту rDNS-проверку — повод отнестись к нему как к потенциальному спуфингу под узнаваемое, вызывающее доверие имя, а не как к настоящему боту экосистемы Internet Archive.
5. robots.txt
# Для контроля доступа Wayback-инфраструктуры
User-agent: archive.org_bot
Disallow: /
# Разрешить — рекомендуемый вариант, если сайт цитируется в Wikimedia-проектах
User-agent: archive.org_bot
Allow: /
Важно: если цель — остановить именно поведение IABot на конкретной статье Wikipedia (а не входящий трафик на ваш сервер), правильный инструмент — не robots.txt, а вики-шаблон {{nobots|deny=InternetArchiveBot}}, добавляемый редакторами прямо в разметку статьи.
6. Контроль на практике
- если запрос успешно прошёл rDNS-проверку на *.archive.org — allow, это часть экосистемы, поддерживающей цитируемость вашего сайта в Wikimedia-проектах;
- чужой UA со словом InternetArchive без подтверждения через rDNS — deny, не полагайтесь на одно только название;
- не путайте блокировку InternetArchiveBot/archive.org_bot с ArchiveBot проекта ArchiveTeam — это независимый, отдельный от Internet Archive инструмент массового веб-архивирования с собственной логикой и сообществом, несмотря на созвучное название;
- для оценки совокупной нагрузки смотрите объём именно по archive.org_bot, а не ищите отдельную строку статистики специально для IABot.
7. Что делать: короткий алгоритм
- Разберите полный UA и сделайте rDNS, прежде чем принимать любое решение — это первый и обязательный шаг для всей этой группы ботов;
- Подтверждённый *.archive.org — allow, если нет принципиальных возражений против архивирования и цитируемости в Wikimedia-проектах;
- Не подтверждён rDNS — deny;
- Хотите остановить поведение бота именно в контексте конкретной статьи Wikipedia — используйте вики-шаблон nobots, а не серверную блокировку;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать InternetArchiveBot
| Бот / сосед | Кластер | Комментарий |
| archive.org_bot | Веб-архивы | Штатный краулер Wayback Machine и Archive-It — технически часто и есть источник фактической нагрузки от «активности IABot» |
| Archive-It | Веб-архивы | Отдельный клиентский подписочный сервис для организаций — см. отдельную статью с разбором реального UA archive.org_bot |
| ArchiveBot (ArchiveTeam) | Веб-архивы (независимый оператор) | Несмотря на созвучное название, не связан с Internet Archive официально — отдельный проект и сообщество |
| ia_archiver | Веб-архивы (статус требует проверки) | Исторически связан с Internet Archive, но по ряду источников позже перешёл к закрытому сервису Alexa — не путать напрямую |
9. Стратегия allow/deny
| Ситуация | Действие |
| rDNS подтверждает *.archive.org, нет возражений | Allow |
| rDNS не подтверждает происхождение | Deny — вероятный спуфинг под узнаваемое имя |
| Нужно остановить активность именно на конкретной статье Wikipedia | Вики-шаблон {{nobots|deny=InternetArchiveBot}}, не серверная блокировка |
| Сайт активно цитируется в Wikimedia-проектах | Allow — блокировка со временем ухудшает состояние ссылок на ваш сайт в источниках статей |
| Встретили ArchiveBot (ArchiveTeam) и приняли за InternetArchiveBot | Разобраться отдельно — это разные операторы, несмотря на похожее название |
Частые вопросы
InternetArchiveBot и archive.org_bot — это одно и то же?
Зачем IABot вообще заходит на мой сайт?
Как остановить IABot именно на конкретной статье Wikipedia?
Как проверить, что запрос действительно от экосистемы Internet Archive?
Стоит ли блокировать этот трафик, если сайт цитируется в Wikipedia?
Чем ArchiveBot отличается от InternetArchiveBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.