TrafficVeil
Боты 7 мин21 августа 2026 г.

special_archiver: краулер Archive-It с открытыми IP-диапазонами

special_archiver — не отдельный независимый бот, а токен того же операторского контура, что и Archive-It: Internet Archive в партнёрстве с Library of Congress. Разбираемся, почему у этого архивного краулера редко для категории есть открыто опубликованные IP-диапазоны, и почему данные о соблюдении robots.txt здесь противоречивы настолько, что полагаться только на файл не стоит.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое special_archiver на самом деле
  2. 2. Зачем special_archiver приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти special_archiver в логах
  5. 5. robots.txt для special_archiver
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать special_archiver
  9. 9. Стратегия allow/deny для special_archiver
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

special_archiver — редкий случай, когда у архивного бота есть не только официальный оператор, но и конкретные, опубликованные IP-диапазоны для верификации. Это краулер Internet Archive, работающий в рамках сервиса Archive-It и партнёрства с Библиотекой Конгресса США (Library of Congress) — тот же оператор, что и у уже разобранного в этой энциклопедии Archive-It, но с собственным, отдельным идентификатором.

1. Что такое special_archiver на самом деле

По данным независимого каталога Known Agents, special_archiver — веб-краулер, которым управляет Internet Archive как часть сервиса Archive-It. Официальная строка UA прямо ссылается на разные партнёрские программы архивирования в зависимости от версии: одни билды указывают на уведомление для веб-мастеров Библиотеки Конгресса (loc.gov/programs/web-archiving), другие — на страницу для владельцев сайтов Archive-It (archive-it.org/files/site-owners-special.html).

Официальное руководство Европейской комиссии по архивной совместимости сайтов прямо называет оба официальных токена сразу — archive.org_bot и special_archiver — и даёт конкретные IP-диапазоны для верификации: 207.241.224.0/20 и 208.70.24.0/21. Это один из немногих архивных ботов в этой энциклопедии, где такая конкретика вообще существует в открытом доступе.

Параметр Значение
Название special_archiver
Оператор Internet Archive, в рамках сервиса Archive-It и партнёрства с Library of Congress
Роль Целевое, партнёрски инициированное архивирование сайтов — тот же принцип, что у Archive-It: конкретная организация-клиент включает сайт в свою коллекцию
User-Agent / паттерн Mozilla/5.0 (compatible; special_archiver/X.X.X +http://www.archive.org/details/archive.org_bot), встречаются версии со ссылкой на loc.gov или archive-it.org
Официальные IP-диапазоны 207.241.224.0/20 и 208.70.24.0/21 — указаны в официальном руководстве Еврокомиссии по архивной совместимости (сверяйте актуальность отдельно, поскольку диапазоны инфраструктуры могли измениться)
robots.txt Данные противоречивы: часть форумных обсуждений webmaster-сообщества цитирует прямое заявление оператора о намеренном обходе robots.txt «для получения наиболее полного и точного представления сайта»; другие давние наблюдатели утверждают, что archive.org исторически соблюдает файл. Однозначного современного подтверждения ни одной из версий не найдено — полагаться только на файл не стоит
Пометка TrafficVeil Легитимный / Веб-архивы

2. Зачем special_archiver приходит на сайт

  • сайт включён в целевую коллекцию, инициированную Archive-It или партнёрской архивной программой (например, Библиотекой Конгресса) — та же логика, что у обычного Archive-It: обход запускает конкретная организация-клиент, а не Internet Archive «в целом»;
  • периодическое обновление уже существующего архивного снимка в рамках длительной коллекции;
  • полный обход сайта с фиксацией HTML и связанных ресурсов на дату посещения — стандартная механика веб-архивирования.

Типичный кейс: тот же паттерн, что у Archive-It — сайт периодически посещается в рамках коллекции, настроенной сторонней организацией, интерес к которой определяется исследовательскими, документальными или compliance-целями конкретного клиента архивной программы.

3. Нагрузка и риски

Полный обход, как и у Archive-It, может быть ощутимым по нагрузке — краулер фиксирует не только HTML, но и связанные ресурсы страницы. Главный практический риск прежний: контент, однажды заснятый, может оставаться доступным в архиве даже после удаления или изменения на самом сайте.

Отдельный нюанс, специфичный именно для special_archiver: поскольку данные о соблюдении robots.txt противоречивы (см. таблицу выше), полагаться на файл как единственный способ исключить сайт из архивирования особенно рискованно для этого конкретного токена — сильнее, чем для многих других записей категории «Веб-архивы».

4. Как найти special_archiver в логах

# Базовый поиск
grep -i "special_archiver" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — сверяйте с опубликованными диапазонами
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "special_archiver" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. В отличие от многих ботов в этой энциклопедии, здесь есть конкретные опубликованные IP-диапазоны (207.241.224.0/20 и 208.70.24.0/21) — но поскольку источник им уже несколько лет, актуальность стоит перепроверять через rDNS, а не полагаться только на статичный список:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
# Ожидаем хост вида *.us.archive.org или похожий поддомен инфраструктуры Internet Archive

5. robots.txt для special_archiver

# Жёсткий запрет
User-agent: special_archiver
Disallow: /

# Разрешить всё
User-agent: special_archiver
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: special_archiver
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

С учётом противоречивых данных о фактическом соблюдении файла этим конкретным краулером — для гарантированного результата запись стоит дублировать серверной блокировкой, не полагаясь на robots.txt как на единственную меру.

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "special_archiver") {
    return 403;
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} special_archiver [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите special_archiver в разделе ботов домена или в /system/bots — а также проверьте соседний archive.org_bot, поскольку это, по сути, тот же операторский контур;
  • для нежелательного сценария — категория «запретить» плюс серверная блокировка, а не только robots.txt;
  • если критично важно исключить сайт из конкретной архивной коллекции — правильный путь, как и с Archive-It, прямой контакт с Internet Archive/Archive-It, а не только техническая настройка;
  • после изменения сверьте логи: хиты special_archiver должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Нет возражений против архивирования — allow, дублировать блокировкой не требуется;
  • Хотите гарантированно исключить сайт — не полагайтесь только на robots.txt, добавьте серверную блокировку и, при необходимости, обратитесь напрямую в Internet Archive/Archive-It;
  • Полный обход создаёт заметную нагрузку — rate-limit как промежуточная мера;
  • Для верификации используйте связку IP-диапазонов и rDNS, а не полагайтесь на список без проверки его текущей актуальности;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать special_archiver

Бот / сосед Кластер Комментарий
Archive-It Веб-архивы (см. отдельную статью) Тот же операторский контур — special_archiver официально описан как часть сервиса Archive-It, а не отдельный независимый оператор
archive.org_bot Веб-архивы Соседний токен той же инфраструктуры Internet Archive; часто фигурирует в одних и тех же официальных руководствах вместе со special_archiver
Heritrix Веб-архивы Открытый краулер-движок, на котором технически построена часть архивных сервисов, включая инфраструктуру Internet Archive
bnf.fr_bot Веб-архивы (с законодательным мандатом) Похожая архивная миссия, но с законодательным мандатом конкретной страны, а не добровольной клиентской моделью Archive-It

9. Стратегия allow/deny для special_archiver

Ситуация Действие
Нет возражений против архивирования Allow + закрыть /admin /cart /api
Критично важно исключить сайт из архива Серверная блокировка + прямое обращение в Internet Archive/Archive-It, не полагаясь только на robots.txt
Полный обход создаёт заметную нагрузку Rate-limit
Нужна верификация IP Сверять с диапазонами 207.241.224.0/20 и 208.70.24.0/21 через rDNS, проверяя актуальность
Подозрение на spoofing UA Не доверять строке UA целиком; смотреть IP/ASN и обратный DNS на поддомены archive.org

Частые вопросы

special_archiver — это отдельный от Archive-It бот?

Нет, по официальным данным это краулер, работающий в рамках того же сервиса Archive-It от Internet Archive.

Есть ли реальные IP-диапазоны для проверки этого бота?

Да, официальное руководство Еврокомиссии называет 207.241.224.0/20 и 208.70.24.0/21 — редкая конкретика для архивных ботов, но её стоит перепроверять на актуальность.

Соблюдает ли special_archiver правила robots.txt?

Данные противоречивы — есть свидетельства как в пользу обхода файла, так и в пользу его соблюдения, поэтому полагаться только на robots.txt рискованно.

Чем special_archiver отличается от archive.org_bot?

Оба токена фигурируют в одних и тех же официальных руководствах как часть одной инфраструктуры Internet Archive, просто с разными версиями и партнёрскими ссылками в строке UA.

Как гарантированно исключить сайт из архива этого краулера?

Не полагаться только на robots.txt — дублировать серверной блокировкой и, при необходимости, обращаться напрямую в Internet Archive или Archive-It.

Связан ли special_archiver с Библиотекой Конгресса США?

Да, часть версий UA прямо ссылается на страницу программы веб-архивирования Library of Congress — это партнёрская, а не только внутренняя инфраструктура Internet Archive.

#special_archiver#Internet Archive#Archive-It#веб-архивы#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.