TrafficVeil
Боты 4 мин2 августа 2026 г.

Internet Archive Bot - проект для периодического архивирования сайтов

Проект архивный проект для периодического архивирования сайтов — фиксирует HTML и ресурсы на дату обхода. Используется библиотеками, музеями интернета и compliance-архивами.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое InternetArchiveBot
  2. 2. Как работает InternetArchiveBot
  3. 3. Нагрузка на сервер
  4. 4. Обнаружение в логах
  5. Поиск по User-Agent
  6. Верификация
  7. 5. robots.txt
  8. 6. Управление на уровне сервера
  9. Nginx
  10. Apache (.htaccess)
  11. Через TrafficVeil
  12. 7. Рекомендации по оптимизации
  13. 8. Сравнение с похожими ботами
  14. 9. Сводная таблица стратегии
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Проект архивный проект для периодического архивирования сайтов — фиксирует HTML и ресурсы на дату обхода. Используется библиотеками, музеями интернета и compliance-архивами. Ниже — практическое руководство: как распознать агент в логах, оценить нагрузку и заблокировать через robots.txt, веб-сервер или TrafficVeil.

1. Что такое InternetArchiveBot

Параметр Значение
Название InternetArchiveBot
User-Agent (токен/паттерн) archive.org_bot
Полная/типовая строка UA archive.org_bot
Категория TrafficVeil Нежелательный / Веб-архивы
Назначение архивация и сохранение снимков страниц
Список IP-адресов ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA
Соблюдение robots.txt Зависит от оператора; для большинства крупных краулеров — да, но часть сервисных/пользовательских fetch-агентов может обходить robots.txt
Используется для обучения моделей Нет

2. Как работает InternetArchiveBot

  • Идентифицируется в access.log по паттерну User-Agent archive.org_bot;
  • Выполняет автоматические HTTP(S)-запросы к публичным URL сайта;
  • Типовая задача: архивация и сохранение снимков страниц;
  • В панели TrafficVeil относится к кластеру «Веб-архивы» и может быть разрешён или запрещён точечно.

3. Нагрузка на сервер

По выборке TrafficVeil (bots-summary  март–июнь 2026) агент archive.org_bot встречался около 2 704 раз суммарно по наблюдаемым доменам. Может забирать много url при полном обходе.

Признаки проблемной активности: рост RPS без роста конверсий, обход пагинации/каталога, повторяющиеся запросы к тяжёлым страницам, давление на origin CPU и bandwidth.

4. Обнаружение в логах

Поиск по User-Agent

# Все запросы
grep -i "archive.org_bot" /var/log/nginx/access.log

# Количество запросов за сегодня
grep -i "archive.org_bot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Частота по дням
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация

User-Agent легко подделать. Для критичных решений дополнительно проверяйте IP/ASN, частоту, path-паттерны и (если оператор публикует) официальные диапазоны адресов.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt

# Полная блокировка
User-agent: archive.org_bot
Disallow: /

# Точечное ограничение
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /

# Разрешить полностью
User-agent: archive.org_bot
Allow: /

Учитывайте: не все агенты строго соблюдают robots.txt. Для гарантированного контроля используйте серверные правила или TrafficVeil.

6. Управление на уровне сервера

Nginx

if ($http_user_agent ~* "archive.org_bot") {
    return 403;
}

# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=archive-org-bot:10m rate=15r/m;

location / {
    if ($http_user_agent ~* "archive.org_bot") {
        limit_req zone=archive-org-bot burst=30 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} archive.org_bot [NC]
RewriteRule ^ - [F,L]

Через TrafficVeil

  • Откройте список известных ботов в панели домена или /system/bots;
  • Найдите archive.org_bot / InternetArchiveBot;
  • Поставьте категорию «запретить» или оставьте разрешённым согласно политике;
  • При необходимости используйте массовые операции allow/deny без правки origin;
  • Проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.

7. Рекомендации по оптимизации

  • В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
  • Не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
  • Сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
  • Для всплесков чаще достаточно rate-limit вместо полного 403;
  • Контент лучше отдавать server-side, если хотите контролируемую индексацию легитимными агентами.

8. Сравнение с похожими ботами

Бот Кластер User-Agent Метка
ArchiveTeam ArchiveBot Веб-архивы archivebot нежелательный
Archive-It Веб-архивы archive-it легитимный
Heritrix Веб-архивы heritrix легитимный
XY-Archive-Compliance-Archiver Веб-архивы xy-archive-compliance-archiver легитимный
archive.org_bot Веб-архивы archive.org-bot легитимный

9. Сводная таблица стратегии

Цель сайта Рекомендация
Бот полезен бизнесу (поиск, превью, мой мониторинг) Allow / разрешить в TrafficVeil
Бот не нужен и только грузит сервер Disallow + запрет в TrafficVeil или 403 на nginx/Apache
Нужен доступ, но беспокоит частота Rate-limit вместо полной блокировки
Нежелательный бот по базе TrafficVeil Запретить в /system/bots и контролировать по логам

 

Частые вопросы

Что такое InternetArchiveBot?

Проект архивный проект для периодического архивирования сайтов — фиксирует HTML и ресурсы на дату обхода. Используется библиотеками, музеями интернета и compliance-архивами.

Как найти InternetArchiveBot в логах?

Ищите строку User-Agent `archive.org_bot` в access.log (nginx/apache) и смотрите частоту, IP и список URL.

Как заблокировать InternetArchiveBot через robots.txt?

Добавьте правило `User-agent: archive.org_bot` и `Disallow: /`. Для гарантированной блокировки дополните серверным 403 или запретом в TrafficVeil.

Стоит ли разрешать InternetArchiveBot?

В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit

Можно ли заблокировать InternetArchiveBot через TrafficVeil?

Да. Найдите `archive.org_bot` / InternetArchiveBot в списке ботов домена или в `/system/bots` и поставьте запрет или лимит без изменения кода сайта.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Microsoft Preview — бот Microsoft

Компонент Microsoft для rich-вставок ссылок — получает метаданные страницы для embed в сообщении. Типичный сценарий: пользователь отправил ссылку в мессенджер или редактор постов. Руководство по MicrosoftPreview (User-Agent microsoftpreview, категория «Превью ссылок в соцсетях»): как распознать в access.log, оценить риски и ограничить доступ.

6 мин

Meta WebIndexer

meta-webindexer — краулер Meta, отвечающий за качество и релевантность поисковых функций Meta AI. Он индексирует публичный веб-контент, чтобы Meta AI мог возвращать более точные ответы с цитированием источников. Это не превью-бот Facebook и не обучающий краулер: собранные данные используются для поискового слоя Meta AI, а не для превью ссылок в соцсетях.

4 мин

Claude Search Bot

Claude-SearchBot — краулер Anthropic, отвечающий за качество и релевантность поисковых функций Claude. Он индексирует публичный веб-контент, чтобы Claude мог возвращать актуальные, точные ответы с цитированием источников, когда пользователь задаёт вопрос, требующий свежих данных из интернета. Это не обучающий краулер: собранные данные используются исключительно для поискового слоя Claude, а не для тренировки моделей.

3 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.