TrafficVeil
Боты 6 мин24 августа 2026 г.

SmarshBot: архив для комплаенса, не угроза

SmarshBot маркируют «нежелательный», хотя это краулер компании Smarsh для архивирования сайта под требования SEC и FINRA. Разбираемся, почему блокировка может создать пробел в обязательной отчётности.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое SmarshBot на самом деле
  2. Зачем SmarshBot приходит на сайт
  3. Почему это не «фоновый шум»
  4. Как найти SmarshBot в логах
  5. robots.txt и настройка через TrafficVeil
  6. Что в итоге делать с SmarshBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Строка smarshbot в базах помечена «нежелательный» с рекомендацией сразу блокировать. На деле оператор официально подтверждён даже в каталоге ботов Cloudflare Radar: это Smarsh Inc. — крупная американская компания архивирования для регуляторного комплаенса, которой пользуются финансовые и государственные организации.

Что такое SmarshBot на самом деле

Smarsh Inc. основана в 2001 году в Портленде (Орегон), сейчас в составе K1 Investment Management, с выручкой свыше $111 млн и 600+ сотрудниками. Продукт Web Archive автоматически захватывает сайт клиента — полные страницы, метаданные, динамический и мультимедийный контент, включая сторонние ссылки, — чтобы создать защищённую от подделки, юридически значимую запись того, что было опубликовано онлайн в конкретный момент. Это нужно для соответствия требованиям SEC, FINRA и других регуляторов.

Параметр Значение
Название SmarshBot
User-Agent / паттерн SmarshBot/1.0
Оператор Smarsh Inc. — компания архивирования для регуляторного комплаенса, с 2001 года; подтверждено на Cloudflare Radar
Категория TrafficVeil Архивирующий краулер для регуляторного комплаенса (не «прочий нежелательный сервис»)
Что делает на сайте Захватывает полную копию сайта клиента (включая динамику и сторонние ссылки) с временной меткой для соответствия SEC/FINRA
Список IP ❌ Публичного списка нет; проверяйте ASN и поведение
robots.txt Официально задокументирована директива User-agent: SmarshBot / Disallow: / на Cloudflare Radar
Пометка TrafficVeil Легитимный — визит почти всегда связан с осознанной подпиской регулируемого бизнеса на комплаенс-архивирование

Зачем SmarshBot приходит на сайт

Владелец сайта — обычно организация в финансовой или государственной сфере — сам настраивает частоту захвата: ежедневно, еженедельно или по своему расписанию для каждого домена или поддомена. Каждый снимок помечается временной меткой и хранится в исходном формате, создавая аудиторский след изменений сайта во времени — именно ради этого клиент и подключает сервис.

Почему это не «фоновый шум»

Если сайт принадлежит регулируемой компании, визиты SmarshBot — не паразитная нагрузка, а часть обязательного комплаенс-процесса: пропущенный снимок может означать пробел в архиве, который потребуется предъявить при проверке регулятора или в судебном споре. Блокировка такого бота без выяснения контекста — риск для регуляторной отчётности бизнеса, а не защита от нежелательного трафика.

Как найти SmarshBot в логах

# Базовый поиск
grep -i "smarshbot" /var/log/nginx/access.log

# Какие разделы захватывает архиватор
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Регулярность — архиваторы обычно ходят по расписанию
grep -i "smarshbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Для верификации сверяйте IP через ASN — официального публичного списка адресов компания не публикует:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

robots.txt и настройка через TrafficVeil

# Разрешить (если сайт подключён к Smarsh для комплаенса)
User-agent: SmarshBot
Allow: /

# Официальная директива для полного запрета
User-agent: SmarshBot
Disallow: /

TrafficVeil: прежде чем переключать SmarshBot в «запретить», уточните у юридической или комплаенс-команды, не подключён ли сайт к архивированию по регуляторным требованиям, — для финансовых, страховых и государственных организаций это стандартная практика. Если подключение подтверждено, оставляйте allow без rate-limit: пропуск снимков может создать реальный пробел в обязательной отчётности.

Что в итоге делать с SmarshBot

Ситуация Действие
Сайт принадлежит регулируемой компании, комплаенс-архивирование подтверждено Allow без rate-limit — снимки должны сниматься полностью и без пропусков
Подключение не установлено, но нагрузка небольшая Уточнить у комплаенс/юридической команды, прежде чем блокировать
Компания точно не подписана на Smarsh Официальная директива User-agent: SmarshBot / Disallow: / либо запрет в TrafficVeil
Подозрение на спуфинг UA Сверять по ASN и по регулярности расписания — настоящий архиватор ходит предсказуемо

Частые вопросы

Правда ли, что оператор бота SmarshBot неизвестен?

Нет, это официально подтверждённый на Cloudflare Radar краулер компании Smarsh Inc., которая с 2001 года занимается архивированием для регуляторного комплаенса.

Зачем SmarshBot захватывает сайт целиком, а не отдельные страницы?

Регуляторы вроде SEC и FINRA требуют полную и точную копию сайта, включая динамический контент, а не просто индексацию текста, поэтому архиватор собирает всё, включая мультимедиа и сторонние ссылки.

Что будет, если заблокировать SmarshBot на сайте регулируемой компании?

Пропущенный снимок может создать пробел в обязательном архиве, который потребуется предъявить при проверке регулятора или в судебном споре.

Есть ли у SmarshBot официальная директива для robots.txt?

Да, официально задокументирована директива User-agent: SmarshBot с Disallow — подтверждённый первоисточник, редкий среди подобных ботов.

Стоит ли автоматически считать SmarshBot подозрительным на любом сайте?

Нет, сначала стоит уточнить у юридической или комплаенс-команды — для финансовых, страховых и государственных организаций такое архивирование обычная практика.

Как отличить настоящий SmarshBot от подделки UA?

Настоящий архиватор обычно заходит по предсказуемому регулярному расписанию, а не хаотично — нерегулярное поведение скорее говорит о спуфинге.

#SmarshBot#Smarsh#боты#краулеры#антибот#комплаенс#архивирование#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

SmarshBot в логах: что это и как настроить