Боты5 мин чтения·9 августа 2026 г.

«Это, возможно, кто-то ещё» — сам Internet Archive о чужих Heritrix

Internet Archive официально признаёт: строка «heritrix» в логах без archive.org может принадлежать постороннему оператору того же open-source ПО. Разбираем, как их отличить, и промежуточный случай с Archive-It.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Heritrix: легитимный веб-архивы

Heritrix в логах — это не всегда Internet Archive. Heritrix — open-source архивный краулер (проект Internet Archive), которым пользуются многие операторы. Сам IA при своих обходах обычно представляется как archive.org_bot. Если в UA есть heritrix, но нет упоминания archive.org — это, скорее всего, чужой инстанс того же ПО. Это не догадка сторонних экспертов — сам Internet Archive прямо пишет об этом в официальной вики проекта: если в логах видна другая строка UA, где всё ещё встречается «heritrix», это может быть кто-то ещё, использующий их открытое программное обеспечение. IA признаёт, что не может напрямую повлиять на поведение чужого инстанса, но готов помочь разобраться в логах и найти источник проблемного краула.

Что означает Heritrix в логах

Параметр Значение
Токен в логах heritrix / Heritrix
ПО Open-source crawler Internet Archive (heritrix3)
UA самого IA (официально) archive.org_bot (+ варианты Wayback Live Record)
Назначение IA Веб-архивирование (Wayback Machine и др.)
robots.txt у Heritrix (режимы для оператора) Полностью соблюдать (obey) / полностью игнорировать (ignore) / использовать собственные кастомные правила вместо обнаруженных на сайте / соблюдать правила только из заданного набора — оператор выбирает режим при настройке краула, это не единая политика для всех инстансов
Верификация IA rDNS на хосты *.archive.org (напр. crawl*.us.archive.org) + forward DNS
Верификация произвольного Heritrix ❌ Нет единого IP — смотрите UA contact URL и поведение
Контакт IA для жалоб на подозрительный краул archive-crawler-agent@lists.sourceforge.net

Промежуточный случай: Archive-It

Есть ещё один нюанс, который стоит знать. Archive-It — отдельная платная программа Internet Archive для библиотек, университетов и организаций, которые строят собственные архивные коллекции. Она тоже использует Heritrix «под капотом» для реального обхода сайтов. В таких случаях контактный URL в строке UA может отличаться от archive.org (там обычно указывают домен самой организации-заказчика), хотя технически обход всё равно идёт через инфраструктуру, связанную с IA. Это не совсем «чужой» краулер, но и не классический archive.org_bot — при разборе логов стоит держать в уме и такой сценарий.

archive.org_bot vs чужой Heritrix

Сигнал Кто Действие
UA archive.org_bot + rDNS archive.org Internet Archive Allow, если хотите Wayback; иначе Disallow archive.org_bot
UA содержит heritrix, контакт указывает на другую организацию Archive-It партнёр или сторонний оператор Оцените контакт индивидуально; часто deny / rate-limit, если пользы нет
Только слово heritrix без контакта Неизвестно Относитесь как к generic scraper
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка

По сводке TrafficVeil (март–июнь 2026, июнь по 14.06) паттерн heritrix — порядка 132 тысяч запросов. Архивные краулы могут быть глубокими (много URL/ассетов на страницу), поэтому объём сам по себе не говорит о недобросовестности — важнее разобраться, чей это конкретно инстанс.

Логи и проверка

grep -iE "heritrix|archive\.org_bot" /var/log/nginx/access.log

# Разделить IA и прочих
grep -i "archive.org_bot" /var/log/nginx/access.log | head
grep -i "heritrix" /var/log/nginx/access.log | grep -vi "archive.org" | head

host 
# для IA ожидайте *.archive.org, затем forward DNS

robots.txt

# Internet Archive
User-agent: archive.org_bot
Disallow: /

# Общий сигнал для инстансов, читающих robots как Heritrix/стандарт
User-agent: *
Disallow: /private/

Сторонний Heritrix с политикой ignore robots проигнорирует файл — нужен серверный deny.

Сервер / TrafficVeil

if ($http_user_agent ~* "heritrix") {
    return 403;
}
# IA отдельно, если хотите сохранить архивирование:
# не включайте archive.org_bot в это правило

TrafficVeil: heritrix — смотрите, это IA, Archive-It партнёр или совершенно чужой краул; нужен Wayback — не режьте верифицированный archive.org_bot; на Google не влияет.

Рекомендации

  • Разделяйте archive.org_bot и generic heritrix — это разные по сути ситуации, несмотря на общее ПО
  • Чужой Heritrix без пользы — deny
  • IA: Allow для архивации или Disallow осознанно
  • Если контакт в UA указывает на организацию, а не на archive.org — проверьте, не Archive-It ли это, прежде чем банить как случайного стороннего оператора
  • Контакты агрессивного краула берите из строки UA; для проблем именно с IA — archive-crawler-agent@lists.sourceforge.net

Стратегия

Цель Действие
Пустить Wayback Allow archive.org_bot + rDNS check
Резать сторонний Heritrix 403 по heritrix (без IA)
Полный отказ от архивации Disallow archive.org_bot + deny

Частые вопросы

Всегда ли строка heritrix в логах означает Internet Archive?
Нет, это открытое ПО, которым пользуются многие операторы; сам IA официально подтверждает, что видит в логах вебмастеров чужие инстансы с тем же названием краулера.
Под каким именем представляется настоящий Internet Archive при обходе?
archive.org_bot, а не просто heritrix — это ключевое отличие для верификации.
Что такое Archive-It и почему это промежуточный случай?
Отдельная платная программа Internet Archive для библиотек и организаций, которая тоже использует Heritrix, но контакт в UA может указывать на саму организацию-заказчика, а не на archive.org.
Всегда ли Heritrix соблюдает robots.txt?
Нет, оператор конкретного инстанса выбирает режим при настройке — полностью соблюдать, полностью игнорировать или использовать собственные правила вместо обнаруженных на сайте.
Куда жаловаться, если обход выдаёт себя за Internet Archive и ведёт себя агрессивно?
На официальный адрес archive-crawler-agent@lists.sourceforge.net, указанный в вики проекта Heritrix.
Как достоверно проверить, что запрос действительно от Internet Archive?
Через reverse DNS на хосты вида .archive.org (например, crawl.us.archive.org) с последующим forward-подтверждением.
#Heritrix#Internet Archive#archive.org_bot#Archive-It#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil