ArchiveBot — IRC-управляемый краулер сообщества ArchiveTeam: обходит сайт, пишет WARC и передаёт архив дальше (часто с перспективой попадания в экосистему Internet Archive / Wayback). Это не штатный archive.org_bot Internet Archive — другой оператор и другая философия.
Параметры
| Параметр | Значение |
|---|---|
| Типичный UA | ArchiveTeam ArchiveBot/… (wpull …) and not Mozilla/5.0 … |
| Токен в логах | ArchiveBot / ArchiveTeam |
| Оператор | ArchiveTeam (волонтёрское сообщество), не «офис IA» |
| Docs | wiki.archiveteam.org/ArchiveBot |
| robots.txt | ❌ Директивы не соблюдает; файл читается только для обнаружения дополнительных ссылок вроде sitemap |
| Технология | Текущий краулер — wpull (Python, wget-совместимый); исторически использовался Wget с Lua-скриптингом |
| Цель | Сохранить сайт «пока не исчез» |
Почему robots.txt здесь не просто игнорируется, а осознанно отвергается
Это не техническое упущение и не мягкая «в целом не гарантируем соблюдение», как у многих других краулеров. У ArchiveTeam есть отдельная страница вики именно про robots.txt, где команда прямо называет стандарт устаревшей и вредной идеей для архивной миссии и заявляет о полном его игнорировании — с прямым советом вебмастерам вообще удалить файл, если он есть. За этим стоит осознанная философия, а не грубость ради эффекта. По словам сооснователя ArchiveTeam Джейсона Скотта, если оставить robots.txt как единственный механизм регулирования, это гарантированно лишает будущее возможности зеркалировать или ссылаться на материалы, которые могли иметь значение далеко за пределами первоначального контекста сайта — сайты закрываются, домены меняют владельцев, robots.txt может появиться задним числом и «стереть» историю, которая уже была публичной.
Не путать
- ArchiveBot (ArchiveTeam) — этот материал, волонтёрский инструмент
- archive.org_bot / IA — краулеры самого Internet Archive, другая политика и другой официальный статус (хотя оба в итоге могут пополнять одну и ту же экосистему Wayback)
- Heritrix — движок, который используют разные операторы, не только IA
Осторожно относитесь к сторонним каталогам ботов: как минимум один известный трекер ошибочно приписывает оператора ArchiveBot компании Wikimedia — это явная ошибка агрегатора, не имеющая отношения к реальности. ArchiveBot принадлежит именно волонтёрскому ArchiveTeam, что подтверждается их собственным GitHub и вики.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil паттерн archivebot — порядка 12 тысяч запросов (март–июнь 2026, июнь по 14.06). На конкретном сайте джоба может быть короткой и плотной (тысячи URL за сессию) или почти нулевой — зависит от того, запустили ли волонтёры архивацию именно вашего домена через IRC-канал.
Логи
grep -iE "ArchiveBot|ArchiveTeam" /var/log/nginx/access.log
Характерно: широкий обход, wpull в UA, фраза «and not Mozilla/5.0» в дефолтном агенте. IP волонтёрских pipeline — разные, единого «белого» списка ArchiveTeam для веба нет.
robots.txt — не полагайтесь
# Не сработает как запрет для ArchiveBot:
User-agent: ArchiveBot
Disallow: /
Имеет смысл только для других ботов. Для ArchiveBot сразу переходите к deny на edge — файл он прочитает, но исключительно чтобы найти дополнительные ссылки, а не чтобы понять, куда нельзя ходить.
Nginx / TrafficVeil
if ($http_user_agent ~* "ArchiveBot|ArchiveTeam") {
return 403;
}
- Не хотите архивацию волонтёрами — только серверный блок / TrafficVeil, robots.txt не поможет
- Ок с сохранением истории сайта — Allow, следите за пиками нагрузки, особенно в начале джобы
- На SEO Google не влияет
Стратегия
| Цель | Действие |
|---|---|
| Остановить ArchiveBot | 403 / deny по UA (+ при необходимости IP), не robots.txt |
| Снизить удар | rate-limit, отдать статику быстро, не отдавать тяжёлые export-URL |
| Разрешить архив | ничего не делать; при пике — связаться через IRC ArchiveTeam |
- AhrefsBot: полное руководство
- Googlebot: полное руководство
- Googlebot-Image
- Googlebot-News
- Googlebot-Video
- Google AdsBot
- Storebot-Google
- Mediapartners-Google (AdSense)
- Feedfetcher-Google
- APIs-Google
- Google-Read-Aloud
- Google-Site-Verification и InspectionTool
- Bingbot (MSN Bot)
- YandexBot
- YandexMetrika
- Yandex Userproxy
- MJ12bot
- SemrushBot
- Amazonbot
- DotBot
- FacebookBot
- Amazon SearchBot
- Yandex Direct Fetcher
- Anthropic AI
- Cohere AI
- llmstxtscan
- HetrixTools
- HeadlessChrome
- crawler_eb
- EECS498
- IntelX
- statdom.ru
- Website-info.net-Robot
Частые вопросы
Действительно ли ArchiveTeam советует вебмастерам удалить robots.txt?
Почему ArchiveTeam выбрала именно такую позицию по robots.txt?
ArchiveBot принадлежит Internet Archive?
Читает ли ArchiveBot файл robots.txt вообще?
Как реально ограничить обход ArchiveBot, если robots.txt не работает?
Можно ли доверять сторонним базам данных ботов на все сто процентов?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.