Строка mirrorweb в логах обычно списывают на безымянную «инфраструктуру платформы». На деле это краулер конкретной компании — MirrorWeb, специализирующейся на архивировании сайтов для регуляторного комплаенса. Если он заходит на сайт, почти всегда это значит, что владелец сайта — регулируемая компания (финансы, страхование, юридические услуги), которой по закону нужно хранить точные исторические снимки собственного сайта.
Что такое mirrorweb на самом деле
MirrorWeb — компания, основанная в Великобритании в 2012 году, сейчас со штаб-квартирой в Остине (США): архивирует сайты, соцсети и коммуникации для соответствия требованиям SEC, FINRA, FCA и MiFID II. Краулер mirrorweb захватывает сайт целиком — включая динамический контент и интерактивные элементы — и упаковывает снимок в неизменяемый формат WARC, пригодный как доказательство при проверках регулятора или в судебных спорах.
| Параметр | Значение |
| Название | mirrorweb |
| User-Agent / паттерн | mirrorweb |
| Оператор | MirrorWeb — компания веб- и коммуникационного архивирования для комплаенса, с 2012 года |
| Категория TrafficVeil | Архивирующий краулер для регуляторного комплаенса (не индексация для поиска) |
| Что делает на сайте | Снимает полную копию сайта — включая динамику и интерактив — для неизменяемого архива WARC |
| Наиболее вероятная причина визита | Владелец сайта сам подключён к MirrorWeb, чтобы соответствовать требованиям регулятора по хранению записей |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Как архиватор, обычно ориентируется на директивы, но полагаться стоит и на подтверждение через клиента |
| Пометка TrafficVeil | Легитимный — визит почти всегда связан с осознанной подпиской бизнеса на комплаенс-архивирование |
Зачем mirrorweb приходит на сайт
Архиваторы вроде mirrorweb заходят по регулярному расписанию — от ежедневного до более редкого, в зависимости от тарифа и требований к частоте снимков, — чтобы фиксировать хронологическую историю изменений сайта. В отличие от поискового краулера, цель не индексация для выдачи, а полная и точная копия страницы «как её видел пользователь» на конкретный момент времени — именно это требуют финансовые и юридические регуляторы.
Почему это не «фоновый шум»
Если сайт принадлежит регулируемой компании, визиты mirrorweb — не паразитная нагрузка, а часть обязательного комплаенс-процесса: пропущенный снимок может означать пробел в архиве, который потребуется предъявить при проверке или судебном споре. Блокировка такого бота без выяснения контекста — риск не для SEO, а для регуляторной отчётности бизнеса.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти mirrorweb в логах
# Базовый поиск
grep -i "mirrorweb" /var/log/nginx/access.log
# Какие разделы захватывает архиватор
grep -i "mirrorweb" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "mirrorweb" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Регулярность — архиваторы обычно ходят по расписанию
grep -i "mirrorweb" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Официального списка IP компания не публикует, поэтому для верификации используйте ASN:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
robots.txt и настройка через TrafficVeil
# Разрешить (если сайт подключён к MirrorWeb для комплаенса)
User-agent: mirrorweb
Allow: /
# Закрыть только чувствительные служебные разделы
User-agent: mirrorweb
Disallow: /admin/
Disallow: /account/
Allow: /
TrafficVeil: прежде чем переключать mirrorweb в «запретить», уточните у юридической или комплаенс-команды, не подключён ли сайт к архивированию по регуляторным требованиям — для финансовых, страховых и юридических компаний это стандартная практика. Если подключение подтверждено, оставляйте allow без rate-limit: пропуск снимков может создать реальный пробел в обязательной отчётности.
Что в итоге делать с mirrorweb
| Ситуация | Действие |
| Сайт принадлежит регулируемой компании, комплаенс-архивирование подтверждено | Allow без rate-limit — снимки должны сниматься полностью и без пропусков |
| Подключение не установлено, но нагрузка небольшая | Уточнить у комплаенс/юридической команды, прежде чем блокировать |
| Компания точно не подписана на MirrorWeb | Точечный Disallow / запрет в TrafficVeil |
| Подозрение на спуфинг UA | Сверять по ASN и по регулярности расписания — настоящий архиватор ходит предсказуемо |
Частые вопросы
Правда ли, что оператор бота mirrorweb неизвестен?
Зачем этот бот вообще снимает сайт целиком, а не отдельные страницы?
Что будет, если заблокировать mirrorweb на сайте регулируемой компании?
Публикует ли MirrorWeb официальный список IP своего краулера?
Стоит ли автоматически считать mirrorweb подозрительным на любом сайте?
Как отличить настоящий mirrorweb от подделки UA?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.