special_archiver — редкий случай, когда у архивного бота есть не только официальный оператор, но и конкретные, опубликованные IP-диапазоны для верификации. Это краулер Internet Archive, работающий в рамках сервиса Archive-It и партнёрства с Библиотекой Конгресса США (Library of Congress) — тот же оператор, что и у уже разобранного в этой энциклопедии Archive-It, но с собственным, отдельным идентификатором.
1. Что такое special_archiver на самом деле
По данным независимого каталога Known Agents, special_archiver — веб-краулер, которым управляет Internet Archive как часть сервиса Archive-It. Официальная строка UA прямо ссылается на разные партнёрские программы архивирования в зависимости от версии: одни билды указывают на уведомление для веб-мастеров Библиотеки Конгресса (loc.gov/programs/web-archiving), другие — на страницу для владельцев сайтов Archive-It (archive-it.org/files/site-owners-special.html).
Официальное руководство Европейской комиссии по архивной совместимости сайтов прямо называет оба официальных токена сразу — archive.org_bot и special_archiver — и даёт конкретные IP-диапазоны для верификации: 207.241.224.0/20 и 208.70.24.0/21. Это один из немногих архивных ботов в этой энциклопедии, где такая конкретика вообще существует в открытом доступе.
| Параметр | Значение |
| Название | special_archiver |
| Оператор | Internet Archive, в рамках сервиса Archive-It и партнёрства с Library of Congress |
| Роль | Целевое, партнёрски инициированное архивирование сайтов — тот же принцип, что у Archive-It: конкретная организация-клиент включает сайт в свою коллекцию |
| User-Agent / паттерн | Mozilla/5.0 (compatible; special_archiver/X.X.X +http://www.archive.org/details/archive.org_bot), встречаются версии со ссылкой на loc.gov или archive-it.org |
| Официальные IP-диапазоны | 207.241.224.0/20 и 208.70.24.0/21 — указаны в официальном руководстве Еврокомиссии по архивной совместимости (сверяйте актуальность отдельно, поскольку диапазоны инфраструктуры могли измениться) |
| robots.txt | Данные противоречивы: часть форумных обсуждений webmaster-сообщества цитирует прямое заявление оператора о намеренном обходе robots.txt «для получения наиболее полного и точного представления сайта»; другие давние наблюдатели утверждают, что archive.org исторически соблюдает файл. Однозначного современного подтверждения ни одной из версий не найдено — полагаться только на файл не стоит |
| Пометка TrafficVeil | Легитимный / Веб-архивы |
2. Зачем special_archiver приходит на сайт
- сайт включён в целевую коллекцию, инициированную Archive-It или партнёрской архивной программой (например, Библиотекой Конгресса) — та же логика, что у обычного Archive-It: обход запускает конкретная организация-клиент, а не Internet Archive «в целом»;
- периодическое обновление уже существующего архивного снимка в рамках длительной коллекции;
- полный обход сайта с фиксацией HTML и связанных ресурсов на дату посещения — стандартная механика веб-архивирования.
Типичный кейс: тот же паттерн, что у Archive-It — сайт периодически посещается в рамках коллекции, настроенной сторонней организацией, интерес к которой определяется исследовательскими, документальными или compliance-целями конкретного клиента архивной программы.
3. Нагрузка и риски
Полный обход, как и у Archive-It, может быть ощутимым по нагрузке — краулер фиксирует не только HTML, но и связанные ресурсы страницы. Главный практический риск прежний: контент, однажды заснятый, может оставаться доступным в архиве даже после удаления или изменения на самом сайте.
Отдельный нюанс, специфичный именно для special_archiver: поскольку данные о соблюдении robots.txt противоречивы (см. таблицу выше), полагаться на файл как единственный способ исключить сайт из архивирования особенно рискованно для этого конкретного токена — сильнее, чем для многих других записей категории «Веб-архивы».
4. Как найти special_archiver в логах
# Базовый поиск
grep -i "special_archiver" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA — сверяйте с опубликованными диапазонами
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. В отличие от многих ботов в этой энциклопедии, здесь есть конкретные опубликованные IP-диапазоны (207.241.224.0/20 и 208.70.24.0/21) — но поскольку источник им уже несколько лет, актуальность стоит перепроверять через rDNS, а не полагаться только на статичный список:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
# Ожидаем хост вида *.us.archive.org или похожий поддомен инфраструктуры Internet Archive
5. robots.txt для special_archiver
# Жёсткий запрет
User-agent: special_archiver
Disallow: /
# Разрешить всё
User-agent: special_archiver
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: special_archiver
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
С учётом противоречивых данных о фактическом соблюдении файла этим конкретным краулером — для гарантированного результата запись стоит дублировать серверной блокировкой, не полагаясь на robots.txt как на единственную меру.
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "special_archiver") {
return 403;
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} special_archiver [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите special_archiver в разделе ботов домена или в /system/bots — а также проверьте соседний archive.org_bot, поскольку это, по сути, тот же операторский контур;
- для нежелательного сценария — категория «запретить» плюс серверная блокировка, а не только robots.txt;
- если критично важно исключить сайт из конкретной архивной коллекции — правильный путь, как и с Archive-It, прямой контакт с Internet Archive/Archive-It, а не только техническая настройка;
- после изменения сверьте логи: хиты special_archiver должны уйти в блок/лимит, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Нет возражений против архивирования — allow, дублировать блокировкой не требуется;
- Хотите гарантированно исключить сайт — не полагайтесь только на robots.txt, добавьте серверную блокировку и, при необходимости, обратитесь напрямую в Internet Archive/Archive-It;
- Полный обход создаёт заметную нагрузку — rate-limit как промежуточная мера;
- Для верификации используйте связку IP-диапазонов и rDNS, а не полагайтесь на список без проверки его текущей актуальности;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать special_archiver
| Бот / сосед | Кластер | Комментарий |
| Archive-It | Веб-архивы (см. отдельную статью) | Тот же операторский контур — special_archiver официально описан как часть сервиса Archive-It, а не отдельный независимый оператор |
| archive.org_bot | Веб-архивы | Соседний токен той же инфраструктуры Internet Archive; часто фигурирует в одних и тех же официальных руководствах вместе со special_archiver |
| Heritrix | Веб-архивы | Открытый краулер-движок, на котором технически построена часть архивных сервисов, включая инфраструктуру Internet Archive |
| bnf.fr_bot | Веб-архивы (с законодательным мандатом) | Похожая архивная миссия, но с законодательным мандатом конкретной страны, а не добровольной клиентской моделью Archive-It |
9. Стратегия allow/deny для special_archiver
| Ситуация | Действие |
| Нет возражений против архивирования | Allow + закрыть /admin /cart /api |
| Критично важно исключить сайт из архива | Серверная блокировка + прямое обращение в Internet Archive/Archive-It, не полагаясь только на robots.txt |
| Полный обход создаёт заметную нагрузку | Rate-limit |
| Нужна верификация IP | Сверять с диапазонами 207.241.224.0/20 и 208.70.24.0/21 через rDNS, проверяя актуальность |
| Подозрение на spoofing UA | Не доверять строке UA целиком; смотреть IP/ASN и обратный DNS на поддомены archive.org |