Если фильтровать access.log по arquivo, часто всплывает целый пласт машинных хитов — это и есть Arquivo-web-crawler, официальный краулер национального веб-архива Португалии. Arquivo-web-crawler принадлежит Arquivo.pt — государственной службе веб-архивации, работающей при FCCN-FCT (Fundação para a Ciência e Tecnologia) с 2007 года. Его задача — сохранять португальский веб для истории и научных исследований, а не проверять или доставлять какую-либо коммерческую функцию клиенту, как это бывает у сервисных ботов. Оператор: Arquivo.pt (FCCN-FCT), государственный веб-архив Португалии. Классификация: легитимный архивный краулер, аналог Wayback Machine и национальных библиотечных архивов других стран.
Что такое Arquivo-web-crawler
| Параметр | Значение |
|---|---|
| Название | Arquivo-web-crawler |
| User-Agent / паттерн | Полная строка содержит ссылку на официальную справку, например: Arquivo-web-crawler (compatible; heritrix/3.4.0-20200304 +https://arquivo.pt/faq-crawling); встречаются варианты на движках brozzler и browsertrix |
| Оператор | Arquivo.pt — национальный веб-архив Португалии, служба FCCN-FCT |
| Роль | Систематически собирает и сохраняет содержимое португальского веба (все сайты в зоне .pt плюс ресурсы «национального значения» на других доменах) для истории и научных исследований |
| Документация / ориентир | sobre.arquivo.pt/en/help/crawling-and-archiving-web-content — официальная справка о краулинге, с прямой ссылкой прямо в строке UA |
| Масштаб архива | Свыше 21 млрд веб-страниц с 47 млн сайтов (на март 2025), 1,4 петабайта данных, история сбора с 1996 года |
| Список IP | Отдельного компактного списка не публикуется; официальный ориентир — сама строка UA со ссылкой на arquivo.pt |
| robots.txt | Официально документировано соблюдение стандартного Disallow (подтверждено каталогом Cloudflare Radar) — в отличие от некоторых других национальных архивов, которые сознательно игнорируют директивы |
| Пометка TrafficVeil | Легитимный / архивный краулер национального значения |
Чем этот краулер отличается от типичных сервисных ботов
В отличие от поисковых или коммерческих краулеров, которые в первую очередь извлекают текст и структурированные данные для индексации, Arquivo-web-crawler забирает страницу целиком — включая CSS, JavaScript и изображения — чтобы впоследствии можно было максимально достоверно воссоздать её исторический внешний вид на конкретный момент времени. Это принципиально другая задача: не индексация для поиска, а полноценная цифровая консервация.
Зачем Arquivo-web-crawler приходит на сайт
- Какие зоны трогает: публичные URL сайта — краулер стремится к полному сохранению страницы, а не к выборочному сбору
- Что ищет: контент сайта в контексте его культурной, образовательной или исторической значимости, особенно в пределах португальской веб-сферы
- Частота визитов: высокотрафиковые сайты и государственные домены могут архивироваться ежедневно, менее известные — раз в месяц или квартал, в зависимости от приоритизации Arquivo.pt
Если сайт связан с Португалией — доменом .pt, языком, тематикой или упоминается как значимый ресурс, — визиты этого бота, скорее всего, часть системного архивного процесса, а не случайность.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски
Учитывая, что краулер стремится к полной, а не выборочной консервации страницы (включая все ассеты), нагрузка может быть заметнее, чем от типичных сервисных ботов, особенно для сайтов с богатым медиаконтентом. Смотрите не только абсолютный RPS, но и паттерн: широкий, но не хаотичный обход, соответствующий заявленной цели полного сохранения страницы, — типичное поведение для этого архива, а не аномалия.
Как найти Arquivo-web-crawler в логах
# Базовый поиск
grep -i "arquivo" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "arquivo" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Официального списка IP Arquivo.pt не публикует, но полная строка UA сама по себе содержит проверяемую ссылку на официальную справку arquivo.pt — это более надёжный ориентир, чем у многих ботов без установленного оператора. При аномальном поведении (нехарактерная концентрация запросов, нетипичные для полного архивного обхода паттерны) стоит обратиться напрямую в Arquivo.pt — на их странице прямо указано, что они готовы разбираться с сообщениями о неожиданном поведении краулера.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для Arquivo-web-crawler
# Жёсткий запрет
User-agent: Arquivo-web-crawler
Disallow: /
# Разрешить всё
User-agent: Arquivo-web-crawler
Allow: /
# Компромисс: закрыть чувствительные разделы, оставить публичный контент
User-agent: Arquivo-web-crawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: соблюдение стандартного robots.txt для этого краулера документировано официально (в отличие, например, от bne.es_bot, разбиравшегося ранее в этой энциклопедии, который сознательно игнорирует директивы по законному мандату) — значит, Disallow здесь должен сработать надёжно.
Рекомендации: что делать с Arquivo-web-crawler
- Сайт связан с Португалией (домен, язык, аудитория) или представляет культурную/историческую ценность — Allow, это часть государственной программы цифрового сохранения, а не коммерческий сбор данных
- Сайт не имеет отношения к Португалии и не хотите архивирования — Disallow, соблюдение подтверждено официально, дополнительный серверный блок обычно не требуется
- Если нагрузка от полного обхода страниц с ассетами ощутимо мешает — можно точечно закрыть тяжёлые медиа-разделы, оставив основной контент доступным
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с этим архивным краулером
Частые вопросы
Кто на самом деле оператор Arquivo-web-crawler?
Чем задача этого краулера отличается от типичного сервисного бота?
Насколько велик архив, который собирает Arquivo.pt?
Соблюдает ли Arquivo-web-crawler правила robots.txt?
Как часто краулер посещает конкретный сайт?
Куда обращаться при подозрении на нетипичное поведение бота?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.