Боты6 мин чтения·24 августа 2026 г.

SmarshBot: архив для комплаенса, не угроза

SmarshBot маркируют «нежелательный», хотя это краулер компании Smarsh для архивирования сайта под требования SEC и FINRA. Разбираемся, почему блокировка может создать пробел в обязательной отчётности.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота SmarshBot: нежелательный прочие краулеры и сервисы

Строка smarshbot в базах помечена «нежелательный» с рекомендацией сразу блокировать. На деле оператор официально подтверждён даже в каталоге ботов Cloudflare Radar: это Smarsh Inc. — крупная американская компания архивирования для регуляторного комплаенса, которой пользуются финансовые и государственные организации.

Что такое SmarshBot на самом деле

Smarsh Inc. основана в 2001 году в Портленде (Орегон), сейчас в составе K1 Investment Management, с выручкой свыше $111 млн и 600+ сотрудниками. Продукт Web Archive автоматически захватывает сайт клиента — полные страницы, метаданные, динамический и мультимедийный контент, включая сторонние ссылки, — чтобы создать защищённую от подделки, юридически значимую запись того, что было опубликовано онлайн в конкретный момент. Это нужно для соответствия требованиям SEC, FINRA и других регуляторов.

Параметр Значение
Название SmarshBot
User-Agent / паттерн SmarshBot/1.0
Оператор Smarsh Inc. — компания архивирования для регуляторного комплаенса, с 2001 года; подтверждено на Cloudflare Radar
Категория TrafficVeil Архивирующий краулер для регуляторного комплаенса (не «прочий нежелательный сервис»)
Что делает на сайте Захватывает полную копию сайта клиента (включая динамику и сторонние ссылки) с временной меткой для соответствия SEC/FINRA
Список IP ❌ Публичного списка нет; проверяйте ASN и поведение
robots.txt Официально задокументирована директива User-agent: SmarshBot / Disallow: / на Cloudflare Radar
Пометка TrafficVeil Легитимный — визит почти всегда связан с осознанной подпиской регулируемого бизнеса на комплаенс-архивирование

Зачем SmarshBot приходит на сайт

Владелец сайта — обычно организация в финансовой или государственной сфере — сам настраивает частоту захвата: ежедневно, еженедельно или по своему расписанию для каждого домена или поддомена. Каждый снимок помечается временной меткой и хранится в исходном формате, создавая аудиторский след изменений сайта во времени — именно ради этого клиент и подключает сервис.

Почему это не «фоновый шум»

Если сайт принадлежит регулируемой компании, визиты SmarshBot — не паразитная нагрузка, а часть обязательного комплаенс-процесса: пропущенный снимок может означать пробел в архиве, который потребуется предъявить при проверке регулятора или в судебном споре. Блокировка такого бота без выяснения контекста — риск для регуляторной отчётности бизнеса, а не защита от нежелательного трафика.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти SmarshBot в логах

# Базовый поиск
grep -i "smarshbot" /var/log/nginx/access.log

# Какие разделы захватывает архиватор
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Регулярность — архиваторы обычно ходят по расписанию
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Для верификации сверяйте IP через ASN — официального публичного списка адресов компания не публикует:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

robots.txt и настройка через TrafficVeil

# Разрешить (если сайт подключён к Smarsh для комплаенса)
User-agent: SmarshBot
Allow: /

# Официальная директива для полного запрета
User-agent: SmarshBot
Disallow: /

TrafficVeil: прежде чем переключать SmarshBot в «запретить», уточните у юридической или комплаенс-команды, не подключён ли сайт к архивированию по регуляторным требованиям, — для финансовых, страховых и государственных организаций это стандартная практика. Если подключение подтверждено, оставляйте allow без rate-limit: пропуск снимков может создать реальный пробел в обязательной отчётности.

Что в итоге делать с SmarshBot

Ситуация Действие
Сайт принадлежит регулируемой компании, комплаенс-архивирование подтверждено Allow без rate-limit — снимки должны сниматься полностью и без пропусков
Подключение не установлено, но нагрузка небольшая Уточнить у комплаенс/юридической команды, прежде чем блокировать
Компания точно не подписана на Smarsh Официальная директива User-agent: SmarshBot / Disallow: / либо запрет в TrafficVeil
Подозрение на спуфинг UA Сверять по ASN и по регулярности расписания — настоящий архиватор ходит предсказуемо

Частые вопросы

Правда ли, что оператор бота SmarshBot неизвестен?
Нет, это официально подтверждённый на Cloudflare Radar краулер компании Smarsh Inc., которая с 2001 года занимается архивированием для регуляторного комплаенса.
Зачем SmarshBot захватывает сайт целиком, а не отдельные страницы?
Регуляторы вроде SEC и FINRA требуют полную и точную копию сайта, включая динамический контент, а не просто индексацию текста, поэтому архиватор собирает всё, включая мультимедиа и сторонние ссылки.
Что будет, если заблокировать SmarshBot на сайте регулируемой компании?
Пропущенный снимок может создать пробел в обязательном архиве, который потребуется предъявить при проверке регулятора или в судебном споре.
Есть ли у SmarshBot официальная директива для robots.txt?
Да, официально задокументирована директива User-agent: SmarshBot с Disallow — подтверждённый первоисточник, редкий среди подобных ботов.
Стоит ли автоматически считать SmarshBot подозрительным на любом сайте?
Нет, сначала стоит уточнить у юридической или комплаенс-команды — для финансовых, страховых и государственных организаций такое архивирование обычная практика.
Как отличить настоящий SmarshBot от подделки UA?
Настоящий архиватор обычно заходит по предсказуемому регулярному расписанию, а не хаотично — нерегулярное поведение скорее говорит о спуфинге.
#SmarshBot#Smarsh#боты#краулеры#антибот#комплаенс#архивирование#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil