Боты6 мин чтения·10 августа 2026 г.

Arquivo-web-crawler: национальный веб-архив Португалии, а не безымянный бот

За этим краулером стоит государственная служба Arquivo.pt с архивом в 21+ миллиард страниц. Разбираем, чем архивная консервация отличается от обычной сервисной проверки, и почему здесь robots.txt реально работает.

TVTrafficVeil TeamЭксперты по защите веб-трафика

Если фильтровать access.log по arquivo, часто всплывает целый пласт машинных хитов — это и есть Arquivo-web-crawler, официальный краулер национального веб-архива Португалии. Arquivo-web-crawler принадлежит Arquivo.pt — государственной службе веб-архивации, работающей при FCCN-FCT (Fundação para a Ciência e Tecnologia) с 2007 года. Его задача — сохранять португальский веб для истории и научных исследований, а не проверять или доставлять какую-либо коммерческую функцию клиенту, как это бывает у сервисных ботов. Оператор: Arquivo.pt (FCCN-FCT), государственный веб-архив Португалии. Классификация: легитимный архивный краулер, аналог Wayback Machine и национальных библиотечных архивов других стран.

Что такое Arquivo-web-crawler

Параметр Значение
Название Arquivo-web-crawler
User-Agent / паттерн Полная строка содержит ссылку на официальную справку, например: Arquivo-web-crawler (compatible; heritrix/3.4.0-20200304 +https://arquivo.pt/faq-crawling); встречаются варианты на движках brozzler и browsertrix
Оператор Arquivo.pt — национальный веб-архив Португалии, служба FCCN-FCT
Роль Систематически собирает и сохраняет содержимое португальского веба (все сайты в зоне .pt плюс ресурсы «национального значения» на других доменах) для истории и научных исследований
Документация / ориентир sobre.arquivo.pt/en/help/crawling-and-archiving-web-content — официальная справка о краулинге, с прямой ссылкой прямо в строке UA
Масштаб архива Свыше 21 млрд веб-страниц с 47 млн сайтов (на март 2025), 1,4 петабайта данных, история сбора с 1996 года
Список IP Отдельного компактного списка не публикуется; официальный ориентир — сама строка UA со ссылкой на arquivo.pt
robots.txt Официально документировано соблюдение стандартного Disallow (подтверждено каталогом Cloudflare Radar) — в отличие от некоторых других национальных архивов, которые сознательно игнорируют директивы
Пометка TrafficVeil Легитимный / архивный краулер национального значения

Чем этот краулер отличается от типичных сервисных ботов

В отличие от поисковых или коммерческих краулеров, которые в первую очередь извлекают текст и структурированные данные для индексации, Arquivo-web-crawler забирает страницу целиком — включая CSS, JavaScript и изображения — чтобы впоследствии можно было максимально достоверно воссоздать её исторический внешний вид на конкретный момент времени. Это принципиально другая задача: не индексация для поиска, а полноценная цифровая консервация.

Зачем Arquivo-web-crawler приходит на сайт

  • Какие зоны трогает: публичные URL сайта — краулер стремится к полному сохранению страницы, а не к выборочному сбору
  • Что ищет: контент сайта в контексте его культурной, образовательной или исторической значимости, особенно в пределах португальской веб-сферы
  • Частота визитов: высокотрафиковые сайты и государственные домены могут архивироваться ежедневно, менее известные — раз в месяц или квартал, в зависимости от приоритизации Arquivo.pt

Если сайт связан с Португалией — доменом .pt, языком, тематикой или упоминается как значимый ресурс, — визиты этого бота, скорее всего, часть системного архивного процесса, а не случайность.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка и риски

Учитывая, что краулер стремится к полной, а не выборочной консервации страницы (включая все ассеты), нагрузка может быть заметнее, чем от типичных сервисных ботов, особенно для сайтов с богатым медиаконтентом. Смотрите не только абсолютный RPS, но и паттерн: широкий, но не хаотичный обход, соответствующий заявленной цели полного сохранения страницы, — типичное поведение для этого архива, а не аномалия.

Как найти Arquivo-web-crawler в логах

# Базовый поиск
grep -i "arquivo" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация

Официального списка IP Arquivo.pt не публикует, но полная строка UA сама по себе содержит проверяемую ссылку на официальную справку arquivo.pt — это более надёжный ориентир, чем у многих ботов без установленного оператора. При аномальном поведении (нехарактерная концентрация запросов, нетипичные для полного архивного обхода паттерны) стоит обратиться напрямую в Arquivo.pt — на их странице прямо указано, что они готовы разбираться с сообщениями о неожиданном поведении краулера.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для Arquivo-web-crawler

# Жёсткий запрет
User-agent: Arquivo-web-crawler
Disallow: /

# Разрешить всё
User-agent: Arquivo-web-crawler
Allow: /

# Компромисс: закрыть чувствительные разделы, оставить публичный контент
User-agent: Arquivo-web-crawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: соблюдение стандартного robots.txt для этого краулера документировано официально (в отличие, например, от bne.es_bot, разбиравшегося ранее в этой энциклопедии, который сознательно игнорирует директивы по законному мандату) — значит, Disallow здесь должен сработать надёжно.

Рекомендации: что делать с Arquivo-web-crawler

  • Сайт связан с Португалией (домен, язык, аудитория) или представляет культурную/историческую ценность — Allow, это часть государственной программы цифрового сохранения, а не коммерческий сбор данных
  • Сайт не имеет отношения к Португалии и не хотите архивирования — Disallow, соблюдение подтверждено официально, дополнительный серверный блок обычно не требуется
  • Если нагрузка от полного обхода страниц с ассетами ощутимо мешает — можно точечно закрыть тяжёлые медиа-разделы, оставив основной контент доступным
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с этим архивным краулером

Частые вопросы

Кто на самом деле оператор Arquivo-web-crawler?
Государственная служба Arquivo.pt при FCCN-FCT, национальный веб-архив Португалии, работающий с 2007 года.
Чем задача этого краулера отличается от типичного сервисного бота?
Он не проверяет интеграцию и не доставляет функцию клиенту, а полностью консервирует страницу — включая CSS, JS и изображения — для исторического сохранения, а не для индексации.
Насколько велик архив, который собирает Arquivo.pt?
Свыше 21 миллиарда веб-страниц с 47 миллионов сайтов, общим объёмом 1,4 петабайта, с историей сбора с 1996 года.
Соблюдает ли Arquivo-web-crawler правила robots.txt?
Да, это официально документировано, в отличие от некоторых других национальных архивов, которые сознательно игнорируют директивы по законному мандату.
Как часто краулер посещает конкретный сайт?
Зависит от значимости: высокотрафиковые и государственные сайты могут архивироваться ежедневно, менее известные — раз в месяц или квартал.
Куда обращаться при подозрении на нетипичное поведение бота?
Напрямую в Arquivo.pt — на их официальной странице указано, что они готовы разбираться с сообщениями о неожиданном поведении краулера.
#Arquivo-web-crawler#Arquivo.pt#национальные веб-архивы#Heritrix#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil