Проект архивный проект для периодического архивирования сайтов — фиксирует HTML и ресурсы на дату обхода. Используется библиотеками, музеями интернета и compliance-архивами. Ниже — практическое руководство: как распознать агент в логах, оценить нагрузку и заблокировать через robots.txt, веб-сервер или TrafficVeil.
1. Что такое InternetArchiveBot
| Параметр | Значение |
|---|---|
| Название | InternetArchiveBot |
| User-Agent (токен/паттерн) | archive.org_bot |
| Полная/типовая строка UA | archive.org_bot |
| Категория TrafficVeil | Нежелательный / Веб-архивы |
| Назначение | архивация и сохранение снимков страниц |
| Список IP-адресов | ❌ Отдельный официальный список есть не у всех операторов; проверяйте ASN/документацию владельца бота и не полагайтесь только на UA |
| Соблюдение robots.txt | Зависит от оператора; для большинства крупных краулеров — да, но часть сервисных/пользовательских fetch-агентов может обходить robots.txt |
| Используется для обучения моделей | Нет |
2. Как работает InternetArchiveBot
- Идентифицируется в access.log по паттерну User-Agent
archive.org_bot; - Выполняет автоматические HTTP(S)-запросы к публичным URL сайта;
- Типовая задача: архивация и сохранение снимков страниц;
- В панели TrafficVeil относится к кластеру «Веб-архивы» и может быть разрешён или запрещён точечно.
3. Нагрузка на сервер
По выборке TrafficVeil (bots-summary март–июнь 2026) агент archive.org_bot встречался около 2 704 раз суммарно по наблюдаемым доменам. Может забирать много url при полном обходе.
Признаки проблемной активности: рост RPS без роста конверсий, обход пагинации/каталога, повторяющиеся запросы к тяжёлым страницам, давление на origin CPU и bandwidth.
4. Обнаружение в логах
Поиск по User-Agent
# Все запросы
grep -i "archive.org_bot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep -i "archive.org_bot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Частота по дням
grep -i "archive.org_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
User-Agent легко подделать. Для критичных решений дополнительно проверяйте IP/ASN, частоту, path-паттерны и (если оператор публикует) официальные диапазоны адресов.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt
# Полная блокировка
User-agent: archive.org_bot
Disallow: /
# Точечное ограничение
User-agent: archive.org_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /account/
Allow: /
# Разрешить полностью
User-agent: archive.org_bot
Allow: /
Учитывайте: не все агенты строго соблюдают robots.txt. Для гарантированного контроля используйте серверные правила или TrafficVeil.
6. Управление на уровне сервера
Nginx
if ($http_user_agent ~* "archive.org_bot") {
return 403;
}
# Мягкий вариант — rate limit
limit_req_zone $binary_remote_addr zone=archive-org-bot:10m rate=15r/m;
location / {
if ($http_user_agent ~* "archive.org_bot") {
limit_req zone=archive-org-bot burst=30 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} archive.org_bot [NC]
RewriteRule ^ - [F,L]
Через TrafficVeil
- Откройте список известных ботов в панели домена или
/system/bots; - Найдите
archive.org_bot/ InternetArchiveBot; - Поставьте категорию «запретить» или оставьте разрешённым согласно политике;
- При необходимости используйте массовые операции allow/deny без правки origin;
- Проверьте логи: запросы должны уходить в блок/лимит согласно выбранной политике.
7. Рекомендации по оптимизации
- В базе TrafficVeil помечен как нежелательный — по умолчанию рекомендуется запрет или жёсткий rate-limit;
- Не блокируйте поисковые роботы Google/Yandex случайно, если рядом настраиваете широкие правила;
- Сначала измерьте долю запросов бота в логах/аналитике TrafficVeil, потом принимайте решение;
- Для всплесков чаще достаточно rate-limit вместо полного 403;
- Контент лучше отдавать server-side, если хотите контролируемую индексацию легитимными агентами.
8. Сравнение с похожими ботами
| Бот | Кластер | User-Agent | Метка |
|---|---|---|---|
| ArchiveTeam ArchiveBot | Веб-архивы | archivebot |
нежелательный |
| Archive-It | Веб-архивы | archive-it |
легитимный |
| Heritrix | Веб-архивы | heritrix |
легитимный |
| XY-Archive-Compliance-Archiver | Веб-архивы | xy-archive-compliance-archiver |
легитимный |
| archive.org_bot | Веб-архивы | archive.org-bot |
легитимный |
9. Сводная таблица стратегии
| Цель сайта | Рекомендация |
|---|---|
| Бот полезен бизнесу (поиск, превью, мой мониторинг) | Allow / разрешить в TrafficVeil |
| Бот не нужен и только грузит сервер | Disallow + запрет в TrafficVeil или 403 на nginx/Apache |
| Нужен доступ, но беспокоит частота | Rate-limit вместо полной блокировки |
| Нежелательный бот по базе TrafficVeil | Запретить в /system/bots и контролировать по логам |