TrafficVeil
Боты 6 мин3 августа 2026 г.

IA archiver - исторически идентификатор краулера Alexa Interne

Классический идентификатор Internet Archive в User-Agent для Wayback Machine. Архивирует публичные страницы с возможностью просмотра прошлых версий. Руководство по ia_archiver (User-Agent ia_archiver, категория «Веб-архивы»): как распознать в access.log, оценить риски и ограничить доступ.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое ia_archiver
  2. 2. Зачем ia_archiver приходит на сайт
  3. 3. Нагрузка и риски именно для ia_archiver
  4. 4. Как найти ia_archiver в логах
  5. Верификация
  6. 5. robots.txt для ia_archiver и archive.org_bot
  7. 6. Блокировка вручную и через TrafficVeil
  8. Nginx
  9. Apache (.htaccess)
  10. TrafficVeil
  11. 7. Рекомендации: что делать с ia_archiver
  12. 8. С кем не путать ia_archiver
  13. 9. Стратегия allow/deny для ia_archiver
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а бот с User-Agent ia_archiver — и здесь важно сразу разобраться, кому именно он принадлежит, потому что расхожее представление об этом UA ошибочно.

Важно с самого начала: ia_archiver — исторически идентификатор краулера Alexa Internet, а не собственного краулера Internet Archive. Alexa (основана в 1996 году тем же Брюстером Кейлом, что и Internet Archive) сканировала веб для своей аналитики трафика и параллельно передавала часть краулов в архив Wayback Machine — модель была симбиотической. В 1999 году Alexa купил Amazon, партнёрство с архивом продолжалось ещё почти два десятилетия. В 2022 году Alexa Internet прекратила работу. Это значит, что сегодняшний трафик с UA ia_archiver в логах — это либо инерционные легаси-скрипты/библиотеки, которые ещё используют старую строку, либо потенциальный спуфинг под давно не поддерживаемого оператора, а не активный официальный краулер с понятным адресатом жалоб.

Собственный краулер Internet Archive, который реально формирует снапшоты для Wayback Machine сегодня, называется иначе — archive.org_bot (на движке Heritrix). Именно с ним, а не с ia_archiver, стоит связывать текущее архивирование сайта.

Категория в энциклопедии TrafficVeil: Веб-архивы (легитимный, но с оговоркой об устаревании самого идентификатора).

1. Что такое ia_archiver

ia_archiver — легаси-строка User-Agent, исторически принадлежавшая краулеру Alexa Internet, донора данных для Wayback Machine до 2022 года.

Параметр Значение
Название ia_archiver
User-Agent / паттерн ia_archiver, полная форма — ia_archiver (+http://www.alexa.com/site/help/webmasters; crawler@alexa.com)
Оператор Alexa Internet (закрыта в 2022 году), исторически связан с Internet Archive
Актуальный краулер Internet Archive archive.org_bot (Heritrix) — не то же самое, что ia_archiver
Роль Исторически — сбор данных для трафик-аналитики Alexa с передачей копий в архив; сегодня — по большей части легаси-трафик или спуфинг
Документация / ориентир Официального актуального оператора для этого конкретного UA не существует — Alexa закрыта
Список IP ❌ Нет актуального официального списка; для archive.org_bot также нет полного публичного списка IP
robots.txt Историческая позиция самого Internet Archive (Oakland Archive Policy) называла ia_archiver «правильным» UA для исключения архива, но независимые разборы это оспаривают — блокировка ia_archiver не обязательно блокирует archive.org_bot
Пометка TrafficVeil Легитимный / Веб-архивы, с пометкой «устаревший идентификатор — проверяйте на актуальность»

2. Зачем ia_archiver приходит на сайт

Строго говоря, в 2026 году полноценного активного оператора у этого конкретного UA нет — Alexa Internet закрыта. Практически трафик с этой строкой сегодня — это:

  • легаси-библиотеки и SEO-инструменты, которые унаследовали старый UA по инерции;
  • редкие скрипты сторонних сервисов, всё ещё представляющихся как Alexa;
  • возможный спуфинг под старый, никем не проверяемый идентификатор.

Какие зоны чаще трогает: публичные URL, исторические разделы, файлы документации — если это легаси-скрипт с похожим поведением на старый краулер.
Чем отличается от браузерного пользователя: нет нормальной сессии, другие интервалы, повторяемый path-паттерн.

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log присутствует ia_archiver на пагинации и карточках. Прежде чем принимать решение allow/deny, стоит уточнить: перед вами устаревший легаси-паттерн или реальный archive.org_bot под похожим именем — от этого зависит, потеряете ли вы архивацию сайта при блокировке.

3. Нагрузка и риски именно для ia_archiver

Отдельной строки в публичной сводке top-bot TrafficVeil у ia_archiver может не быть — сам объём этого конкретного UA в 2026 году, как правило, невелик именно из-за закрытия Alexa. Основные риски в категории «Веб-архивы» относятся скорее к реальному краулеру Internet Archive (archive.org_bot):

  • полный обход может быть тяжёлым по нагрузке;
  • контент может остаться в архиве даже после удаления или изменения на сайте — это отдельно значимо для промо- и бонусных страниц: акция закончилась, текст на сайте обновили, а старая версия с прежними условиями продолжает жить в Wayback Machine и индексироваться поисковиками как «архивная копия»;
  • в 2025–2026 годах ряд крупных издателей (например, New York Times, The Guardian, Reddit) начали блокировать archive.org_bot, опасаясь, что архивные копии используются для обучения AI-моделей в обход robots.txt текущей версии сайта — стоит держать это в уме при выборе allow/deny стратегии для всей категории «Веб-архивы», а не только для ia_archiver.

Практический риск: устаревшие бонусные условия и промокоды, попавшие в архив, продолжают быть доступны через Wayback Machine и после того, как акция официально завершилась.

4. Как найти ia_archiver в логах

Не ищите «просто ботов» — ищите конкретный токен ia_archiver, но параллельно проверяйте и archive.org_bot — это разные операторы, и путать их в отчётности не стоит.

# Базовый поиск по легаси-UA
grep -i "ia_archiver" /var/log/nginx/access.log

# Отдельно — актуальный краулер Internet Archive
grep -i "archive.org_bot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "ia_archiver" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от похожих строк семейства архивов
grep -iE "ia_archiver|archive.org_bot|heritrix|archive-it" /var/log/nginx/access.log | wc -l

Верификация

Подделать User-Agent может любой скрипт — а для строки ia_archiver, у которой уже нет активного официального оператора, это особенно актуально: любой запрос с этим UA стоит рассматривать скептически по умолчанию. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для ia_archiver и archive.org_bot

# Легаси-UA — блокировать по умолчанию, если нет явной причины разрешать
User-agent: ia_archiver
Disallow: /

# Актуальный краулер Internet Archive — если archiving желателен
User-agent: archive.org_bot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Дополнительно Internet Archive поддерживает исключение на уровне отдельной страницы через мета-тег в <head>, а также форму на удаление уже сохранённых снимков (opt-out removal request) — это отдельный инструмент для случаев, когда нужно убрать из архива уже существующий снапшот, а не только заблокировать будущий обход.

Важно: историческая позиция самого Internet Archive называла ia_archiver «правильным» UA для исключения архива через robots.txt, но независимые технические разборы это оспаривают — блокировка ia_archiver сама по себе не обязательно блокирует archive.org_bot. Если цель — реально не попадать в архив, ориентируйтесь на archive.org_bot, а не только на легаси-строку.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "ia_archiver") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=iaarchiver:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "ia_archiver") {
        limit_req zone=iaarchiver burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ia_archiver [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите ia_archiver и отдельно archive.org_bot в ботах домена или в /system/bots — это два разных объекта, не сводите их в одну запись;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • Allow только при явной пользе от архивации именно через archive.org_bot;
  • После изменения сверьте логи: хиты по обеим строкам должны вести себя так, как задумано, а нужные поисковики остаться.

7. Рекомендации: что делать с ia_archiver

  • Если это легаси-ia_archiver без явной пользы — Disallow/403 по умолчанию;
  • Если нужна архивация сайта — ориентируйтесь на allow для archive.org_bot, а не на ia_archiver;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке archive.org_bot: страницы не попадут (или перестанут обновляться) в Wayback Machine; блокировка одного лишь ia_archiver на это, вероятнее всего, не повлияет.

8. С кем не путать ia_archiver

Бот / сосед Кластер UA Комментарий
archive.org_bot Веб-архивы archive.org_bot Актуальный краулер Internet Archive (движок Heritrix) — легитимный, именно он формирует снапшоты Wayback Machine сегодня
Heritrix Веб-архивы heritrix Движок, на котором работает archive.org_bot, а не отдельный независимый бот
Archive-It Веб-архивы archive-it Партнёрская программа Internet Archive для целевых коллекций (библиотеки, университеты) — может работать по своим правилам обхода
Common Crawl Веб-архивы / датасеты ccbot Отдельный некоммерческий архивный проект, данные которого также используются для обучения AI-моделей

9. Стратегия allow/deny для ia_archiver

Ситуация Действие
Видите только легаси-ia_archiver без пользы Disallow по умолчанию — активного оператора у этого UA больше нет
Нужна архивация через Wayback Machine Allow для archive.org_bot, отдельно от ia_archiver
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен доступ, но пики по ночам Rate-limit на nginx/TrafficVeil
Подозрение на спуфинг под старый UA Не доверять строке UA; смотреть IP/ASN и поведение

Частые вопросы

Что делает бот ia_archiver?

Классический идентификатор Internet Archive в User-Agent для Wayback Machine. Архивирует публичные страницы с возможностью просмотра прошлых версий.

Опасен ли ia_archiver для сайта?

Полный обход может быть тяжёлым; контент может остаться в архиве даже после удаления на сайте. По метке TrafficVeil бот скорее легитимный: решение allow/deny принимайте по бизнес-пользе, а не «на всякий случай».

Как отличить ia_archiver от других ботов?

По токену User-Agent `ia_archiver` и паттерну URL. Соседей по семейству: смотрите таблицу сравнения в статье.

Нужно ли блокировать ia_archiver?

Disallow/403 для ia_archiver, если пользы нет Альтернатива: Allow только при явной пользе от ia_archiver

Хватит ли robots.txt против ia_archiver?

Если оператор соблюдает robots.txt — да для вежливого режима. Для гарантии используйте nginx/Apache или запрет `ia_archiver` в TrafficVeil.

Что будет, если заблокировать ia_archiver?

Страницы не попадут (или перестанут обновляться) в соответствующий архив.

#Веб-архивы#ia_archiver
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

AwarioBot — семейство краулеров сервиса Awario

Семья краулеров Awario (AwarioBot / SmartBot / RssBot) для brand monitoring. Официальные UA, Crawl-delay, без IP-листа. Как закрыть все токены без влияния на Google.

6 мин

Microsoft Preview — бот Microsoft

Компонент Microsoft для rich-вставок ссылок — получает метаданные страницы для embed в сообщении. Типичный сценарий: пользователь отправил ссылку в мессенджер или редактор постов. Руководство по MicrosoftPreview (User-Agent microsoftpreview, категория «Превью ссылок в соцсетях»): как распознать в access.log, оценить риски и ограничить доступ.

6 мин

Meta WebIndexer

meta-webindexer — краулер Meta, отвечающий за качество и релевантность поисковых функций Meta AI. Он индексирует публичный веб-контент, чтобы Meta AI мог возвращать более точные ответы с цитированием источников. Это не превью-бот Facebook и не обучающий краулер: собранные данные используются для поискового слоя Meta AI, а не для превью ссылок в соцсетях.

4 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

IA archiver - исторически идентификатор краулера Alexa Interne