Боты4 мин чтения·12 августа 2026 г.

SMTBot: что это за бот SimilarTech и нужно ли его блокировать

Что такое SMTBot от SimilarTech, зачем он анализирует до 200 страниц сайта, какие технологии определяет и как настроить robots.txt, Allow или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота SMTBot: нежелательный прочие краулеры и сервисы

SMTBot — специализированный веб-краулер SimilarTech, предназначенный для определения технологий, используемых на сайтах.

В отличие от Googlebot или других поисковых роботов SMTBot не пытается создать полноценный индекс всего сайта. SimilarTech официально называет его focused web crawler: робот получает ограниченный набор страниц и анализирует их, чтобы точнее определить технологический стек сайта.

Официальная документация указывает ещё одну важную особенность: SMTBot должен обходить не более 200 страниц одного сайта. Это принципиально отличает его от crawler, задача которых — максимально полно пройти весь ссылочный граф.

Параметр Значение
Название SMTBot
Оператор SimilarTech / экосистема Similarweb
Категория Technology Intelligence / Tech Profiling
Основной UA SMTBot/1.0
Назначение Определение технологий, используемых сайтом
Тип crawler Focused crawler
Максимальная глубина Не более примерно 200 страниц по официальному описанию
robots.txt Соблюдает правила для SMTBot
Поисковый робот Нет
Базовая политика TrafficVeil Allow / Monitor

Кому принадлежит SMTBot

SMTBot принадлежит SimilarTech. Сам SimilarTech исторически тесно связан с Similarweb.

Similarweb рассказывал, что SimilarTech создавался как отдельный продукт внутри предпринимательской экосистемы Similarweb и использовал её инфраструктуру и данные. Позже отношения стали ещё теснее: в апреле 2021 года Similarweb приобрёл практически все активы SimilarTech.

Поэтому для TrafficVeil логично показывать:

Operator: SimilarTech
Parent ecosystem: Similarweb

Зачем SMTBot приходит на сайт

SimilarTech использует crawler для более точного определения технологий, установленных на сайтах. Это официально заявленная цель SMTBot.

Такие системы обычно анализируют признаки, доступные в публичной части сайта:

  • HTML-разметку;
  • JavaScript;
  • имена и пути статических ресурсов;
  • meta-теги;
  • сетевые запросы и URL внешних сервисов;
  • характерные признаки CMS;
  • аналитические и маркетинговые скрипты;
  • виджеты;
  • библиотеки и frontend-фреймворки.

На основании этих признаков сервис может определить, какие технологии используются на сайте.

Какие технологии может определять SimilarTech

Technology intelligence сервисы такого типа могут классифицировать множество компонентов.

Например:

Категория Примеры
CMS WordPress, Drupal, Joomla и другие CMS
Analytics Системы аналитики и tag management
Advertising Рекламные и retargeting-платформы
Frontend JavaScript-фреймворки и библиотеки
E-commerce Платформы интернет-магазинов
Widgets Чаты, формы, социальные виджеты
Infrastructure Некоторые CDN, hosting и web-компоненты

Важно: наличие SMTBot в access.log не означает security scanning. Его официально заявленная цель — определение технологий сайта.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Почему SMTBot не обходит сайт целиком

Для technology profiling обычно нет необходимости читать десятки тысяч страниц.

Технологический стек часто становится понятен после анализа ограниченного набора характерных URL:

/
 /about/
 /products/
 /blog/
 /contact/

Именно поэтому SimilarTech использует focused crawler.

Официальная документация подчёркивает:

SMTBot не пытается индексировать весь сайт и ограничивает обход небольшим числом страниц — максимум около 200.

Почему лимит 200 страниц важен для антибота

Это хороший behavioural signal.

Если TrafficVeil видит:

User-Agent: SMTBot

50–150 публичных страниц
умеренная скорость
стабильная инфраструктура

такое поведение хорошо согласуется с официальным профилем.

Но если тот же UA делает:

50 000 URL
/.env
/.git/config
/wp-login.php
/phpmyadmin/
/backup.zip

это уже плохо соответствует назначению официального SMTBot.

Как выглядит User-Agent SMTBot

Самый известный вариант:

Mozilla/5.0 (compatible; SMTBot/1.0; +http://www.similartech.com/smtbot)

Исторически наблюдались и browser-like варианты:

Mozilla/5.0 (Windows NT 10.0; Win64; x64)
AppleWebKit/537.36 (KHTML, like Gecko)
Chrome/94.0.4606.81 Safari/537.36
(compatible; SMTBot/1.0; +http://www.similartech.com/smtbot)

Такие строки фиксируются независимыми каталогами User-Agent.

Для обнаружения лучше использовать устойчивый токен:

SMTBot

а не точную версию Chrome или платформы.

Как найти SMTBot в access.log

Базовый поиск:

grep -i "SMTBot" /var/log/nginx/access.log

Количество запросов:

grep -ic "SMTBot" /var/log/nginx/access.log

Топ URL:

grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

Топ IP:

grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

HTTP-коды:

grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn

Как проверить глубину обхода

Так как SimilarTech сам указывает предел около 200 страниц, полезно посчитать число уникальных URL.

grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort -u \
| wc -l

Если один сеанс SMTBot стабильно уходит далеко за несколько сотен уникальных страниц, TrafficVeil может повышать anomaly score.

Можно ли доверять одному User-Agent

Нет.

Даже у легитимного и документированного crawler User-Agent остаётся обычным HTTP-заголовком.

Любой клиент может написать:

User-Agent: Mozilla/5.0 (compatible; SMTBot/1.0;
+http://www.similartech.com/smtbot)

Поэтому TrafficVeil не должен автоматически выдавать Trusted Allow только по совпадению имени.

Как TrafficVeil должен проверять SMTBot

Лучше использовать несколько признаков одновременно:

  • UA;
  • IP;
  • ASN;
  • ASN organization;
  • network type;
  • TLS fingerprint;
  • HTTP fingerprint;
  • глубину обхода;
  • частоту;
  • типы запрашиваемых URL;
  • историю предыдущих визитов.

Официального IP feed нет

На официальной странице SMTBot SimilarTech не публикует компактный список IP или JSON feed для верификации crawler. Страница описывает назначение, глубину и robots.txt, но не предоставляет IP-ranges.

Поэтому IP, увиденные TrafficVeil, лучше разделять на:

Статус Значение
Observed IP С адреса наблюдался SMTBot UA
Probable IP Инфраструктура и поведение стабильно совпадают с SMTBot
Verified IP Есть официальное подтверждение оператора

Соблюдает ли SMTBot robots.txt

Да.

SimilarTech прямо отвечает на этот вопрос в документации: SMTBot следует правилам robots.txt для User-Agent SMTBot.

Полный запрет:

User-agent: SMTBot
Disallow: /

Это должен быть основной первый способ отказаться от crawling SimilarTech.

Частичное ограничение SMTBot

Если владелец сайта не против technology profiling публичной части, но хочет закрыть отдельные области:

User-agent: SMTBot
Disallow: /admin/
Disallow: /account/
Disallow: /checkout/
Disallow: /internal/
Allow: /

Но помнить нужно о стандартном правиле: robots.txt не защищает секретные данные.

robots.txt — не ACL

Даже если SMTBot его соблюдает, закрытые разделы должны защищаться настоящими механизмами авторизации.

Например:

/admin/
/internal-api/
/private/

нельзя считать безопасными только потому, что они находятся в Disallow.

Как заблокировать SMTBot через Nginx

Если требуется принудительный запрет:

if ($http_user_agent ~* "SMTBot") {
    return 403;
}

Однако для официального crawler SimilarTech логичнее сначала использовать robots.txt, поскольку его соблюдение подтверждено самим оператором.

Блокировка через Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} SMTBot [NC]
RewriteRule ^ - [F,L]

Стоит ли блокировать SMTBot

Зависит от отношения владельца сайта к technology profiling.

SMTBot не является поисковым crawler и не приносит классическую SEO-ценность.

Его польза заключается в другом: технология сайта может быть обнаружена и представлена в данных SimilarTech / связанных technology intelligence продуктах.

Когда имеет смысл Allow

Разрешение может быть нормальным вариантом, если:

  • владельцу сайта не мешает technology profiling;
  • нагрузка минимальна;
  • crawler соответствует ожидаемому профилю;
  • технологии сайта и так публично определяются;
  • нет требований ограничивать сторонний сбор таких данных.

Когда имеет смысл Block

Блокировка разумна, если:

  • владелец не хочет участвовать в базах technology intelligence;
  • crawler не приносит бизнес-пользы;
  • возникает лишняя нагрузка;
  • источник ведёт себя нетипично;
  • политика компании ограничивает сторонний автоматизированный profiling.

Нужен ли Rate Limit

Для подтверждённого SMTBot специальный жёсткий Rate Limit обычно не должен быть первым решением.

Официальный crawler уже ограничен собственной focused-моделью и не должен пытаться индексировать сайт целиком.

Если TrafficVeil видит большое количество запросов, сначала стоит проверить:

  1. действительно ли UA похож на SMTBot;
  2. сколько уникальных URL;
  3. не превышает ли профиль заявленные примерно 200 страниц;
  4. из каких ASN приходит трафик;
  5. нет ли spoofing;
  6. что именно запрашивает клиент.

Как оценивать нагрузку SMTBot

По внутренней сводке TrafficVeil наблюдалось порядка 2,1 тыс. запросов. Эту цифру лучше показывать с конкретным периодом измерения, поскольку она является статистикой TrafficVeil, а не глобальным количеством запросов SimilarTech.

Для оценки полезнее сочетать несколько показателей:

Метрика Что показывает
Requests Общий объём активности
Unique URLs Глубину focused crawl
Unique IP Размер наблюдаемой инфраструктуры
ASN Сети источников
RPS/RPM Интенсивность
Bandwidth Стоимость трафика
Cache HIT Какая часть не дошла до origin
Origin requests Реальную нагрузку

Повлияет ли блокировка SMTBot на Google

Нет прямой связи.

SMTBot не является Googlebot.

Отдельное правило:

User-agent: SMTBot
Disallow: /

не блокирует:

Googlebot
Googlebot-Image
AdsBot-Google
Bingbot
YandexBot

Поэтому блокировка SMTBot сама по себе не снимает сайт с обычного поискового индексирования.

SMTBot не является AI crawler

SMTBot также не стоит относить к AI/LLM crawler только потому, что он автоматически анализирует контент.

Официально SimilarTech указывает конкретную функцию:

более точное определение технологий, используемых на сайтах.

Поэтому для TrafficVeil правильнее:

Technology Intelligence
→ Tech Profiling
→ SMTBot

а не:

AI & LLM Crawlers

Как учитывать SMTBot в аналитике

SMTBot — автоматизированный crawler, поэтому его запросы не должны увеличивать число реальных посетителей.

Рекомендуется:

  • исключать из Human Traffic;
  • не учитывать как конверсию;
  • не относить автоматически к вредоносным ботам;
  • учитывать отдельно в Technology Intelligence traffic;
  • показывать число уникальных URL;
  • отслеживать соответствие focused-crawl профилю.

Как определить spoofed SMTBot

Признак Официальный профиль Подозрительный профиль
Глубина Небольшое число страниц, максимум около 200 Тысячи/десятки тысяч URL
Цель Публичные web-страницы Служебные и секретные файлы
Поведение Focused crawl Vulnerability scanning
UA Стабильный SMTBot Название без соответствующего поведения
Инфраструктура Повторяемая Хаотичная proxy/residential rotation

Рекомендуемая карточка TrafficVeil

Поле Значение
Name SMTBot
Operator SimilarTech
Parent ecosystem Similarweb
Category Technology Intelligence
Subtype Tech Profiling
UA SMTBot/1.0
Crawl model Focused
Max pages ~200 according to SimilarTech
robots.txt Yes
Official IP feed Not published on bot page
Default action Allow / Monitor
Human analytics Exclude
Bot analytics Include

Стратегия Allow / Monitor / Block

Ситуация Действие
Technology profiling не мешает Allow
Нужна только статистика Monitor
Не хотите присутствовать в profiling-базах Disallow
robots.txt не помогает Block
Нагрузка неожиданно высокая Verify → Rate Limit
UA используется для security scanning Block как spoofing

Что показывать пользователю TrafficVeil

Вместо общего:

«Легитимный crawler. Решение зависит от бизнес-пользы.»

можно дать более информативное описание:

SMTBot — crawler SimilarTech для определения технологий сайта. Он выполняет focused crawl и по официальной документации получает не более примерно 200 страниц, соблюдая robots.txt. Если вы не хотите, чтобы ваш технологический стек анализировался SimilarTech, crawler можно отключить отдельным правилом.

Итог

SMTBot — легитимный focused crawler SimilarTech для technology profiling. Его задача — не индексировать весь сайт для поисковой выдачи, а получить ограниченное число страниц и определить используемые технологии.

SimilarTech прямо указывает два важных ограничения: SMTBot получает не более примерно 200 страниц и соблюдает robots.txt для User-Agent SMTBot.

Поэтому для TrafficVeil его лучше классифицировать как Technology Intelligence / Tech Profiling со стандартной политикой Allow / Monitor.

Если владелец сайта не хочет участвовать в подобном profiling, первым шагом должен быть Disallow для SMTBot. Если же клиент с таким UA демонстрирует глубокое сканирование, перебирает технические файлы или сильно превышает официальный focused-профиль, TrafficVeil должен проверить spoofing и принимать решение уже по фактическому поведению.

Частые вопросы

Что такое SMTBot?
SMTBot — официальный focused web crawler SimilarTech. Компания прямо указывает, что он не пытается индексировать сайт целиком, а получает небольшое число страниц — максимум около 200 — для более точного определения используемых веб-технологий.
Кто является оператором SMTBot?
SMTBot связан с SimilarTech. SimilarTech исторически тесно связан с Similarweb: проект создавался с использованием инфраструктуры Similarweb, а в 2021 году Similarweb приобрёл практически все активы SimilarTech.
Соблюдает ли SMTBot robots.txt?
Да. Официальная страница SimilarTech прямо говорит, что SMTBot следует правилам robots.txt для User-Agent
Что именно ищет SMTBot?
Его задача — точнее определять технологии, используемые сайтом. Это могут быть CMS, системы аналитики, рекламные и маркетинговые инструменты, JavaScript-библиотеки, виджеты и другие компоненты, которые можно определить по HTML, JavaScript и связанным ресурсам. Основную цель — technology identification — SimilarTech подтверждает официально.
Повлияет ли блокировка SMTBot на Google?
Нет прямой связи. SMTBot не является Googlebot и не участвует в обычном индексировании Google Search. Точечная блокировка SMTBot не блокирует Googlebot.
Нужно ли блокировать SMTBot?
Если владельцу сайта не мешает присутствие его технологического стека в базе SimilarTech, подтверждённого SMTBot можно разрешить. Если profiling не нужен, отдельный Disallow или Block — нормальный вариант. Так как официальный crawler ограничивает глубину и соблюдает robots.txt, первым способом ограничения логично использовать именно robots.txt.
#Прочие краулеры и сервисы#smtbot
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil