Боты5 мин чтения·10 августа 2026 г.

«Удалите robots.txt» — официальный совет ArchiveTeam вебмастерам

ArchiveTeam не просто игнорирует robots.txt технически — у них есть целая вики-страница, объясняющая это как осознанную архивную философию. Разбираем логику, реального оператора и почему robots.txt здесь бессилен.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ArchiveTeam ArchiveBot: нежелательный бот

ArchiveBot — IRC-управляемый краулер сообщества ArchiveTeam: обходит сайт, пишет WARC и передаёт архив дальше (часто с перспективой попадания в экосистему Internet Archive / Wayback). Это не штатный archive.org_bot Internet Archive — другой оператор и другая философия.

Параметры

Параметр Значение
Типичный UA ArchiveTeam ArchiveBot/… (wpull …) and not Mozilla/5.0 …
Токен в логах ArchiveBot / ArchiveTeam
Оператор ArchiveTeam (волонтёрское сообщество), не «офис IA»
Docs wiki.archiveteam.org/ArchiveBot
robots.txt ❌ Директивы не соблюдает; файл читается только для обнаружения дополнительных ссылок вроде sitemap
Технология Текущий краулер — wpull (Python, wget-совместимый); исторически использовался Wget с Lua-скриптингом
Цель Сохранить сайт «пока не исчез»

Почему robots.txt здесь не просто игнорируется, а осознанно отвергается

Это не техническое упущение и не мягкая «в целом не гарантируем соблюдение», как у многих других краулеров. У ArchiveTeam есть отдельная страница вики именно про robots.txt, где команда прямо называет стандарт устаревшей и вредной идеей для архивной миссии и заявляет о полном его игнорировании — с прямым советом вебмастерам вообще удалить файл, если он есть. За этим стоит осознанная философия, а не грубость ради эффекта. По словам сооснователя ArchiveTeam Джейсона Скотта, если оставить robots.txt как единственный механизм регулирования, это гарантированно лишает будущее возможности зеркалировать или ссылаться на материалы, которые могли иметь значение далеко за пределами первоначального контекста сайта — сайты закрываются, домены меняют владельцев, robots.txt может появиться задним числом и «стереть» историю, которая уже была публичной.

Не путать

  • ArchiveBot (ArchiveTeam) — этот материал, волонтёрский инструмент
  • archive.org_bot / IA — краулеры самого Internet Archive, другая политика и другой официальный статус (хотя оба в итоге могут пополнять одну и ту же экосистему Wayback)
  • Heritrix — движок, который используют разные операторы, не только IA

Осторожно относитесь к сторонним каталогам ботов: как минимум один известный трекер ошибочно приписывает оператора ArchiveBot компании Wikimedia — это явная ошибка агрегатора, не имеющая отношения к реальности. ArchiveBot принадлежит именно волонтёрскому ArchiveTeam, что подтверждается их собственным GitHub и вики.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка

По сводке TrafficVeil паттерн archivebot — порядка 12 тысяч запросов (март–июнь 2026, июнь по 14.06). На конкретном сайте джоба может быть короткой и плотной (тысячи URL за сессию) или почти нулевой — зависит от того, запустили ли волонтёры архивацию именно вашего домена через IRC-канал.

Логи

grep -iE "ArchiveBot|ArchiveTeam" /var/log/nginx/access.log

Характерно: широкий обход, wpull в UA, фраза «and not Mozilla/5.0» в дефолтном агенте. IP волонтёрских pipeline — разные, единого «белого» списка ArchiveTeam для веба нет.

robots.txt — не полагайтесь

# Не сработает как запрет для ArchiveBot:
User-agent: ArchiveBot
Disallow: /

Имеет смысл только для других ботов. Для ArchiveBot сразу переходите к deny на edge — файл он прочитает, но исключительно чтобы найти дополнительные ссылки, а не чтобы понять, куда нельзя ходить.

Nginx / TrafficVeil

if ($http_user_agent ~* "ArchiveBot|ArchiveTeam") {
    return 403;
}
  • Не хотите архивацию волонтёрами — только серверный блок / TrafficVeil, robots.txt не поможет
  • Ок с сохранением истории сайта — Allow, следите за пиками нагрузки, особенно в начале джобы
  • На SEO Google не влияет

Стратегия

Цель Действие
Остановить ArchiveBot 403 / deny по UA (+ при необходимости IP), не robots.txt
Снизить удар rate-limit, отдать статику быстро, не отдавать тяжёлые export-URL
Разрешить архив ничего не делать; при пике — связаться через IRC ArchiveTeam

Частые вопросы

Действительно ли ArchiveTeam советует вебмастерам удалить robots.txt?
Да, это буквально написано на их официальной вики-странице, посвящённой этому файлу — не преувеличение и не сарказм.
Почему ArchiveTeam выбрала именно такую позицию по robots.txt?
По словам сооснователя команды, если полагаться только на этот файл, теряется возможность сохранить материалы, которые могут иметь значение далеко за пределами исходного сайта — домены меняются, а правила добавляются задним числом.
ArchiveBot принадлежит Internet Archive?
Нет, это отдельный волонтёрский инструмент сообщества ArchiveTeam, хотя собранные архивы часто в итоге попадают в экосистему Wayback Machine того же Internet Archive.
Читает ли ArchiveBot файл robots.txt вообще?
Да, но только для поиска дополнительных ссылок вроде sitemap — сами директивы Disallow при этом не учитываются.
Как реально ограничить обход ArchiveBot, если robots.txt не работает?
Через блокировку на уровне сервера или в TrafficVeil по UA и, при необходимости, по IP — это единственный рабочий метод.
Можно ли доверять сторонним базам данных ботов на все сто процентов?
Не всегда — как минимум один известный каталог ошибочно приписывает оператора ArchiveBot компании Wikimedia, что не соответствует действительности.
#ArchiveBot#ArchiveTeam#wpull#веб-архивация#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil