Heritrix в логах — это не всегда Internet Archive. Heritrix — open-source архивный краулер (проект Internet Archive), которым пользуются многие операторы. Сам IA при своих обходах обычно представляется как archive.org_bot. Если в UA есть heritrix, но нет упоминания archive.org — это, скорее всего, чужой инстанс того же ПО. Это не догадка сторонних экспертов — сам Internet Archive прямо пишет об этом в официальной вики проекта: если в логах видна другая строка UA, где всё ещё встречается «heritrix», это может быть кто-то ещё, использующий их открытое программное обеспечение. IA признаёт, что не может напрямую повлиять на поведение чужого инстанса, но готов помочь разобраться в логах и найти источник проблемного краула.
Что означает Heritrix в логах
| Параметр | Значение |
|---|---|
| Токен в логах | heritrix / Heritrix |
| ПО | Open-source crawler Internet Archive (heritrix3) |
| UA самого IA (официально) | archive.org_bot (+ варианты Wayback Live Record) |
| Назначение IA | Веб-архивирование (Wayback Machine и др.) |
| robots.txt у Heritrix (режимы для оператора) | Полностью соблюдать (obey) / полностью игнорировать (ignore) / использовать собственные кастомные правила вместо обнаруженных на сайте / соблюдать правила только из заданного набора — оператор выбирает режим при настройке краула, это не единая политика для всех инстансов |
| Верификация IA | rDNS на хосты *.archive.org (напр. crawl*.us.archive.org) + forward DNS |
| Верификация произвольного Heritrix | ❌ Нет единого IP — смотрите UA contact URL и поведение |
| Контакт IA для жалоб на подозрительный краул | archive-crawler-agent@lists.sourceforge.net |
Промежуточный случай: Archive-It
Есть ещё один нюанс, который стоит знать. Archive-It — отдельная платная программа Internet Archive для библиотек, университетов и организаций, которые строят собственные архивные коллекции. Она тоже использует Heritrix «под капотом» для реального обхода сайтов. В таких случаях контактный URL в строке UA может отличаться от archive.org (там обычно указывают домен самой организации-заказчика), хотя технически обход всё равно идёт через инфраструктуру, связанную с IA. Это не совсем «чужой» краулер, но и не классический archive.org_bot — при разборе логов стоит держать в уме и такой сценарий.
archive.org_bot vs чужой Heritrix
| Сигнал | Кто | Действие |
|---|---|---|
| UA archive.org_bot + rDNS archive.org | Internet Archive | Allow, если хотите Wayback; иначе Disallow archive.org_bot |
| UA содержит heritrix, контакт указывает на другую организацию | Archive-It партнёр или сторонний оператор | Оцените контакт индивидуально; часто deny / rate-limit, если пользы нет |
| Только слово heritrix без контакта | Неизвестно | Относитесь как к generic scraper |
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil (март–июнь 2026, июнь по 14.06) паттерн heritrix — порядка 132 тысяч запросов. Архивные краулы могут быть глубокими (много URL/ассетов на страницу), поэтому объём сам по себе не говорит о недобросовестности — важнее разобраться, чей это конкретно инстанс.
Логи и проверка
grep -iE "heritrix|archive\.org_bot" /var/log/nginx/access.log
# Разделить IA и прочих
grep -i "archive.org_bot" /var/log/nginx/access.log | head
grep -i "heritrix" /var/log/nginx/access.log | grep -vi "archive.org" | head
host
# для IA ожидайте *.archive.org, затем forward DNS
robots.txt
# Internet Archive
User-agent: archive.org_bot
Disallow: /
# Общий сигнал для инстансов, читающих robots как Heritrix/стандарт
User-agent: *
Disallow: /private/
Сторонний Heritrix с политикой ignore robots проигнорирует файл — нужен серверный deny.
Сервер / TrafficVeil
if ($http_user_agent ~* "heritrix") {
return 403;
}
# IA отдельно, если хотите сохранить архивирование:
# не включайте archive.org_bot в это правило
TrafficVeil: heritrix — смотрите, это IA, Archive-It партнёр или совершенно чужой краул; нужен Wayback — не режьте верифицированный archive.org_bot; на Google не влияет.
Рекомендации
- Разделяйте archive.org_bot и generic heritrix — это разные по сути ситуации, несмотря на общее ПО
- Чужой Heritrix без пользы — deny
- IA: Allow для архивации или Disallow осознанно
- Если контакт в UA указывает на организацию, а не на archive.org — проверьте, не Archive-It ли это, прежде чем банить как случайного стороннего оператора
- Контакты агрессивного краула берите из строки UA; для проблем именно с IA — archive-crawler-agent@lists.sourceforge.net
Стратегия
| Цель | Действие |
|---|---|
| Пустить Wayback | Allow archive.org_bot + rDNS check |
| Резать сторонний Heritrix | 403 по heritrix (без IA) |
| Полный отказ от архивации | Disallow archive.org_bot + deny |
Частые вопросы
Всегда ли строка heritrix в логах означает Internet Archive?
Под каким именем представляется настоящий Internet Archive при обходе?
Что такое Archive-It и почему это промежуточный случай?
Всегда ли Heritrix соблюдает robots.txt?
Куда жаловаться, если обход выдаёт себя за Internet Archive и ведёт себя агрессивно?
Как достоверно проверить, что запрос действительно от Internet Archive?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.