TrafficVeil
Боты 7 мин21 августа 2026 г.

Archive-It: ищите archive.org_bot, а не archive-it

По официальной документации поддержки Archive-It реальный токен краулера — archive.org_bot, а не буквальное «archive-it» из черновика, и от этого зависит, увидите ли вы вообще этот трафик в логах. Разбираемся, чем клиентский сервис Archive-It отличается от общего краулинга Wayback Machine, почему одно только правило в robots.txt не гарантирует исключение из архива, и что делать, если контент критично важно оттуда убрать.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Archive-It на самом деле
  2. 2. Зачем Archive-It приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти Archive-It в логах
  5. 5. robots.txt для Archive-It
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать Archive-It
  9. 9. Стратегия allow/deny для Archive-It
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Прежде чем настраивать правило для Archive-It, стоит проверить сам токен: по официальной документации службы поддержки Archive-It, реальный User-Agent краулера — archive.org_bot, а не буквально «archive-it», как в черновике. Это не просто техническая деталь: если фильтровать логи по неверному токену, можно не увидеть реальный трафик сервиса вовсе.

1. Что такое Archive-It на самом деле

Archive-It — платная подписочная услуга Internet Archive для организаций (библиотек, университетов, госорганов, музеев, некоммерческих организаций), которые сами настраивают тематические коллекции сайтов для долгосрочного архивирования — своих собственных или сторонних, представляющих исследовательский или архивный интерес. Если этот краулер посещает ваш сайт, это почти всегда значит, что какая-то конкретная организация-клиент Archive-It включила ваш домен в свою коллекцию — а не что Internet Archive в целом решил заархивировать именно вас.

Важно отличать Archive-It от общего краулинга Wayback Machine самим Internet Archive: в апреле 2017 года Internet Archive объявил, что в целом перестаёт полагаться на robots.txt для своего основного архивного краулинга. Archive-It как отдельный клиентский сервис, судя по актуальной (2025 года) документации поддержки, продолжает по умолчанию уважать robots.txt и Crawl-delay для своей «стандартной» технологии обхода — это разные продукты с разной политикой.

Параметр Значение
Название Archive-It
Оператор Internet Archive — сервис для организаций-клиентов, которые сами настраивают коллекции для архивирования
Реальный User-Agent archive.org_bot — по прямому указанию официальной службы поддержки Archive-It (не «archive-it», как в черновике)
Кто инициирует обход Конкретная организация-клиент, которая включила сайт в свою коллекцию — не Internet Archive «в целом»
robots.txt — «стандартная» технология По умолчанию уважает все исключения robots.txt и Crawl-delay
robots.txt — технология Brozzler Уважает большинство исключений, но по умолчанию игнорирует исключения на встроенных ресурсах (изображения, стили) и Crawl-delay
Возможность обхода правила клиентом Если владельца сайта не удаётся связаться, клиент Archive-It может добавить правило «Ignore Robots.txt» для конкретной коллекции — то есть исключение в вашем файле не гарантированно остановит целенаправленный сбор
IP-диапазон Официально не публикуется в открытом доступе, но доступен по запросу через тикет в поддержку Archive-It
Пометка TrafficVeil Легитимный / Веб-архивы

2. Зачем Archive-It приходит на сайт

  • сайт включён в тематическую коллекцию конкретной организации-клиента Archive-It — для научных исследований, отраслевого мониторинга, документирования событий или compliance-целей;
  • краулер сохраняет снимки страниц для долгосрочного хранения — по заявлению самой службы поддержки, «вежливо», то есть не должен создавать заметную нагрузку на производительность или безопасность сайта;
  • частота повторных визитов определяется настройками конкретной коллекции клиента, а не единым расписанием Internet Archive.

Типичный кейс: сайт периодически посещается краулером с не всегда очевидной регулярностью — это может означать как разовый архивный снимок для конкретного исследовательского проекта, так и регулярный мониторинг в рамках длительной коллекции клиента (например, отслеживание изменений на сайтах госорганов или новостных ресурсов).

3. Нагрузка и риски

Полный обход сайта, как отмечено в черновике, может быть ощутимым по нагрузке — особенно если используется технология Brozzler, которая при рендеринге страницы подгружает и встроенные ресурсы (изображения, стили) даже вопреки исключениям в robots.txt для этих типов файлов.

Главный практический риск — необратимость архивирования: контент, once заснятый, может оставаться доступным в архиве даже после удаления или изменения на самом сайте, и это распространяется не только на текст, но и на визуальное оформление, если использовалась технология с полным рендерингом. Учитывая, что клиент Archive-It может обойти исключение в robots.txt при отсутствии ответа от владельца сайта, полагаться только на файл для защиты от архивирования не стоит.

4. Как найти Archive-It в логах

# Базовый поиск по официальному UA
grep -i "archive.org_bot" /var/log/nginx/access.log

# На всякий случай проверьте и буквальный токен из черновика — вдруг он тоже встречается в вашей конфигурации
grep -i "archive-it" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Строку UA подделать может любой скрипт. Официальный IP-диапазон Archive-It не публикуется открыто, но его можно запросить через тикет в службу поддержки Archive-It — это более надёжный путь, чем полагаться на общий ASN Internet Archive:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Archive-It

# Жёсткий запрет — по умолчанию должен сработать для "стандартной" технологии обхода
User-agent: archive.org_bot
Disallow: /

# Разрешить всё
User-agent: archive.org_bot
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важная оговорка: правило сработает для «стандартной» технологии обхода Archive-It по умолчанию, но клиент сервиса может сознательно обойти его через собственные настройки коллекции, если сочтёт это необходимым и не сможет связаться с владельцем сайта. Для полной уверенности в исключении из архива правильный путь — прямой контакт с Internet Archive/Archive-It, а не только технический файл.

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "archive.org_bot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=archiveit:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "archive.org_bot") {
        limit_req zone=archiveit burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} archive.org_bot [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите archive.org_bot (и на всякий случай archive-it) в разделе ботов домена или в /system/bots;
  • для нежелательного сценария — категория «запретить», но учитывайте, что технический запрет не отменяет уже сделанные архивные снимки;
  • если контент уже полностью удалён из открытого доступа на сайте, но остаётся в архиве и это критично — обращайтесь напрямую в Internet Archive, а не только настраивайте техническую блокировку;
  • после изменения сверьте логи: хиты archive.org_bot должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Ищите в логах правильный токен — archive.org_bot, а не «archive-it», иначе рискуете не увидеть реальный трафик сервиса;
  • Полный обход создаёт заметную нагрузку — учитывайте, что технология Brozzler дополнительно подгружает встроенные ресурсы даже при частичных исключениях в robots.txt;
  • Критично важно не допустить архивирования конкретного контента — не полагайтесь только на robots.txt, свяжитесь с Internet Archive напрямую;
  • Нужен точный IP-диапазон для верификации — запросите его через тикет в поддержку Archive-It, а не полагайтесь на общий ASN;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать Archive-It

Важная поправка к таблице «соседей» из черновика: ia_archiver исторически был краулером Internet Archive, но по независимым источникам этот конкретный токен позже перешёл к сервису Alexa Internet (ныне закрытому Amazon в 2022 году) — что делает его текущий статус неоднозначным и требующим отдельной проверки, а не автоматического включения в один ряд с Archive-It и archive.org_bot.

Бот / сосед Кластер UA Комментарий
Heritrix Веб-архивы heritrix легитимный, открытый краулер, на котором построена технология обхода многих архивных сервисов, включая частично Archive-It
ia_archiver Веб-архивы (требует проверки) ia_archiver Исторически связан с Internet Archive, но по ряду источников позже перешёл к ныне закрытому сервису Alexa — статус неоднозначен, не путать напрямую с Archive-It
special_archiver Веб-архивы special_archiver легитимный
bnf.fr_bot Веб-архивы (с законодательным мандатом) bnf.fr_bot Похожая архивная миссия, но с законодательным мандатом конкретной страны — Archive-It работает на добровольной клиентской основе

9. Стратегия allow/deny для Archive-It

Ситуация Действие
Нет возражений против архивирования Allow + закрыть /admin /cart /api
Полный обход создаёт заметную нагрузку Rate-limit, учитывая дополнительную нагрузку от встроенных ресурсов при технологии Brozzler
Критично важно исключить контент из архива Технический Disallow + прямое обращение в Internet Archive, поскольку клиент сервиса технически может обойти файл
Нужна точная верификация IP Запросить диапазон через тикет в поддержку Archive-It
Подозрение на spoofing UA Проверять именно archive.org_bot, а не буквальный «archive-it»; смотреть IP/ASN

Частые вопросы

Какой на самом деле User-Agent использует Archive-It?

По официальной документации поддержки — archive.org_bot, а не буквальный токен «archive-it».

Чем Archive-It отличается от общего краулинга Wayback Machine?

Это отдельный платный сервис для организаций-клиентов, которые сами настраивают коллекции сайтов для архивирования, с собственной, более консервативной политикой по robots.txt.

Гарантирует ли Disallow в robots.txt исключение сайта из архива?

Нет, если владелец сайта недоступен, клиент Archive-It может обойти это правило через настройку своей коллекции.

Что делать, если контент критично важно убрать из архива?

Обратиться напрямую в Internet Archive, а не полагаться только на техническую блокировку.

Почему технология Brozzler создаёт больше нагрузки, чем стандартный обход?

Она по умолчанию подгружает встроенные ресурсы страницы — изображения и стили — даже при частичных исключениях в robots.txt.

Стоит ли доверять записи ia_archiver в списке «соседей» Archive-It?

Не полностью — по ряду источников этот токен позже перешёл к закрытому сервису Alexa, и его текущий статус требует отдельной проверки.

#Archive-It#Internet Archive#веб-архивы#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.