В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а бот с User-Agent ia_archiver — и здесь важно сразу разобраться, кому именно он принадлежит, потому что расхожее представление об этом UA ошибочно.
Важно с самого начала: ia_archiver — исторически идентификатор краулера Alexa Internet, а не собственного краулера Internet Archive. Alexa (основана в 1996 году тем же Брюстером Кейлом, что и Internet Archive) сканировала веб для своей аналитики трафика и параллельно передавала часть краулов в архив Wayback Machine — модель была симбиотической. В 1999 году Alexa купил Amazon, партнёрство с архивом продолжалось ещё почти два десятилетия. В 2022 году Alexa Internet прекратила работу. Это значит, что сегодняшний трафик с UA ia_archiver в логах — это либо инерционные легаси-скрипты/библиотеки, которые ещё используют старую строку, либо потенциальный спуфинг под давно не поддерживаемого оператора, а не активный официальный краулер с понятным адресатом жалоб.
Собственный краулер Internet Archive, который реально формирует снапшоты для Wayback Machine сегодня, называется иначе — archive.org_bot (на движке Heritrix). Именно с ним, а не с ia_archiver, стоит связывать текущее архивирование сайта.
Категория в энциклопедии TrafficVeil: Веб-архивы (легитимный, но с оговоркой об устаревании самого идентификатора).
1. Что такое ia_archiver
ia_archiver — легаси-строка User-Agent, исторически принадлежавшая краулеру Alexa Internet, донора данных для Wayback Machine до 2022 года.
| Параметр | Значение |
| Название | ia_archiver |
| User-Agent / паттерн | ia_archiver, полная форма — ia_archiver (+http://www.alexa.com/site/help/webmasters; crawler@alexa.com) |
| Оператор | Alexa Internet (закрыта в 2022 году), исторически связан с Internet Archive |
| Актуальный краулер Internet Archive | archive.org_bot (Heritrix) — не то же самое, что ia_archiver |
| Роль | Исторически — сбор данных для трафик-аналитики Alexa с передачей копий в архив; сегодня — по большей части легаси-трафик или спуфинг |
| Документация / ориентир | Официального актуального оператора для этого конкретного UA не существует — Alexa закрыта |
| Список IP | ❌ Нет актуального официального списка; для archive.org_bot также нет полного публичного списка IP |
| robots.txt | Историческая позиция самого Internet Archive (Oakland Archive Policy) называла ia_archiver «правильным» UA для исключения архива, но независимые разборы это оспаривают — блокировка ia_archiver не обязательно блокирует archive.org_bot |
| Пометка TrafficVeil | Легитимный / Веб-архивы, с пометкой «устаревший идентификатор — проверяйте на актуальность» |
2. Зачем ia_archiver приходит на сайт
Строго говоря, в 2026 году полноценного активного оператора у этого конкретного UA нет — Alexa Internet закрыта. Практически трафик с этой строкой сегодня — это:
- легаси-библиотеки и SEO-инструменты, которые унаследовали старый UA по инерции;
- редкие скрипты сторонних сервисов, всё ещё представляющихся как Alexa;
- возможный спуфинг под старый, никем не проверяемый идентификатор.
Какие зоны чаще трогает: публичные URL, исторические разделы, файлы документации — если это легаси-скрипт с похожим поведением на старый краулер.
Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.
Типичный кейс: ночью RPS растёт, конверсий нет. В access.log присутствует ia_archiver на пагинации и карточках. Прежде чем принимать решение allow/deny, стоит уточнить: перед вами устаревший легаси-паттерн или реальный archive.org_bot под похожим именем — от этого зависит, потеряете ли вы архивацию сайта при блокировке.
3. Нагрузка и риски именно для ia_archiver
Отдельной строки в публичной сводке top-bot TrafficVeil у ia_archiver может не быть — сам объём этого конкретного UA в 2026 году, как правило, невелик именно из-за закрытия Alexa. Основные риски в категории «Веб-архивы» относятся скорее к реальному краулеру Internet Archive (archive.org_bot):
- полный обход может быть тяжёлым по нагрузке;
- контент может остаться в архиве даже после удаления или изменения на сайте — это отдельно значимо для промо- и бонусных страниц: акция закончилась, текст на сайте обновили, а старая версия с прежними условиями продолжает жить в Wayback Machine и индексироваться поисковиками как «архивная копия»;
- в 2025–2026 годах ряд крупных издателей (например, New York Times, The Guardian, Reddit) начали блокировать
archive.org_bot, опасаясь, что архивные копии используются для обучения AI-моделей в обход robots.txt текущей версии сайта — стоит держать это в уме при выборе allow/deny стратегии для всей категории «Веб-архивы», а не только дляia_archiver.
Практический риск: устаревшие бонусные условия и промокоды, попавшие в архив, продолжают быть доступны через Wayback Machine и после того, как акция официально завершилась.
4. Как найти ia_archiver в логах
Не ищите «просто ботов» — ищите конкретный токен ia_archiver, но параллельно проверяйте и archive.org_bot — это разные операторы, и путать их в отчётности не стоит.
# Базовый поиск по легаси-UA
grep -i "ia_archiver" /var/log/nginx/access.log
# Отдельно — актуальный краулер Internet Archive
grep -i "archive.org_bot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от похожих строк семейства архивов
grep -iE "ia_archiver|archive.org_bot|heritrix|archive-it" /var/log/nginx/access.log | wc -l
Верификация
Подделать User-Agent может любой скрипт — а для строки ia_archiver, у которой уже нет активного официального оператора, это особенно актуально: любой запрос с этим UA стоит рассматривать скептически по умолчанию. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для ia_archiver и archive.org_bot
# Легаси-UA — блокировать по умолчанию, если нет явной причины разрешать
User-agent: ia_archiver
Disallow: /
# Актуальный краулер Internet Archive — если archiving желателен
User-agent: archive.org_bot
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Дополнительно Internet Archive поддерживает исключение на уровне отдельной страницы через мета-тег в <head>, а также форму на удаление уже сохранённых снимков (opt-out removal request) — это отдельный инструмент для случаев, когда нужно убрать из архива уже существующий снапшот, а не только заблокировать будущий обход.
Важно: историческая позиция самого Internet Archive называла ia_archiver «правильным» UA для исключения архива через robots.txt, но независимые технические разборы это оспаривают — блокировка ia_archiver сама по себе не обязательно блокирует archive.org_bot. Если цель — реально не попадать в архив, ориентируйтесь на archive.org_bot, а не только на легаси-строку.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "ia_archiver") {
return 403;
}
limit_req_zone $binary_remote_addr zone=iaarchiver:10m rate=10r/m;
location / {
if ($http_user_agent ~* "ia_archiver") {
limit_req zone=iaarchiver burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ia_archiver [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите
ia_archiverи отдельноarchive.org_botв ботах домена или в /system/bots — это два разных объекта, не сводите их в одну запись; - Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
- Allow только при явной пользе от архивации именно через
archive.org_bot; - После изменения сверьте логи: хиты по обеим строкам должны вести себя так, как задумано, а нужные поисковики остаться.
7. Рекомендации: что делать с ia_archiver
- Если это легаси-
ia_archiverбез явной пользы — Disallow/403 по умолчанию; - Если нужна архивация сайта — ориентируйтесь на allow для
archive.org_bot, а не наia_archiver; - Если нагрузка мешает — сначала rate-limit, затем полный запрет;
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot; - Что будет при блокировке
archive.org_bot: страницы не попадут (или перестанут обновляться) в Wayback Machine; блокировка одного лишьia_archiverна это, вероятнее всего, не повлияет.
8. С кем не путать ia_archiver
| Бот / сосед | Кластер | UA | Комментарий |
| archive.org_bot | Веб-архивы | archive.org_bot | Актуальный краулер Internet Archive (движок Heritrix) — легитимный, именно он формирует снапшоты Wayback Machine сегодня |
| Heritrix | Веб-архивы | heritrix | Движок, на котором работает archive.org_bot, а не отдельный независимый бот |
| Archive-It | Веб-архивы | archive-it | Партнёрская программа Internet Archive для целевых коллекций (библиотеки, университеты) — может работать по своим правилам обхода |
| Common Crawl | Веб-архивы / датасеты | ccbot | Отдельный некоммерческий архивный проект, данные которого также используются для обучения AI-моделей |
9. Стратегия allow/deny для ia_archiver
| Ситуация | Действие |
Видите только легаси-ia_archiver без пользы |
Disallow по умолчанию — активного оператора у этого UA больше нет |
| Нужна архивация через Wayback Machine | Allow для archive.org_bot, отдельно от ia_archiver |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен доступ, но пики по ночам | Rate-limit на nginx/TrafficVeil |
| Подозрение на спуфинг под старый UA | Не доверять строке UA; смотреть IP/ASN и поведение |