SMTBot — специализированный веб-краулер SimilarTech, предназначенный для определения технологий, используемых на сайтах.
В отличие от Googlebot или других поисковых роботов SMTBot не пытается создать полноценный индекс всего сайта. SimilarTech официально называет его focused web crawler: робот получает ограниченный набор страниц и анализирует их, чтобы точнее определить технологический стек сайта.
Официальная документация указывает ещё одну важную особенность: SMTBot должен обходить не более 200 страниц одного сайта. Это принципиально отличает его от crawler, задача которых — максимально полно пройти весь ссылочный граф.
| Параметр | Значение |
|---|---|
| Название | SMTBot |
| Оператор | SimilarTech / экосистема Similarweb |
| Категория | Technology Intelligence / Tech Profiling |
| Основной UA | SMTBot/1.0 |
| Назначение | Определение технологий, используемых сайтом |
| Тип crawler | Focused crawler |
| Максимальная глубина | Не более примерно 200 страниц по официальному описанию |
| robots.txt | Соблюдает правила для SMTBot |
| Поисковый робот | Нет |
| Базовая политика TrafficVeil | Allow / Monitor |
Кому принадлежит SMTBot
SMTBot принадлежит SimilarTech. Сам SimilarTech исторически тесно связан с Similarweb.
Similarweb рассказывал, что SimilarTech создавался как отдельный продукт внутри предпринимательской экосистемы Similarweb и использовал её инфраструктуру и данные. Позже отношения стали ещё теснее: в апреле 2021 года Similarweb приобрёл практически все активы SimilarTech.
Поэтому для TrafficVeil логично показывать:
Operator: SimilarTech
Parent ecosystem: Similarweb
Зачем SMTBot приходит на сайт
SimilarTech использует crawler для более точного определения технологий, установленных на сайтах. Это официально заявленная цель SMTBot.
Такие системы обычно анализируют признаки, доступные в публичной части сайта:
- HTML-разметку;
- JavaScript;
- имена и пути статических ресурсов;
- meta-теги;
- сетевые запросы и URL внешних сервисов;
- характерные признаки CMS;
- аналитические и маркетинговые скрипты;
- виджеты;
- библиотеки и frontend-фреймворки.
На основании этих признаков сервис может определить, какие технологии используются на сайте.
Какие технологии может определять SimilarTech
Technology intelligence сервисы такого типа могут классифицировать множество компонентов.
Например:
| Категория | Примеры |
|---|---|
| CMS | WordPress, Drupal, Joomla и другие CMS |
| Analytics | Системы аналитики и tag management |
| Advertising | Рекламные и retargeting-платформы |
| Frontend | JavaScript-фреймворки и библиотеки |
| E-commerce | Платформы интернет-магазинов |
| Widgets | Чаты, формы, социальные виджеты |
| Infrastructure | Некоторые CDN, hosting и web-компоненты |
Важно: наличие SMTBot в access.log не означает security scanning. Его официально заявленная цель — определение технологий сайта.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Почему SMTBot не обходит сайт целиком
Для technology profiling обычно нет необходимости читать десятки тысяч страниц.
Технологический стек часто становится понятен после анализа ограниченного набора характерных URL:
/
/about/
/products/
/blog/
/contact/
Именно поэтому SimilarTech использует focused crawler.
Официальная документация подчёркивает:
SMTBot не пытается индексировать весь сайт и ограничивает обход небольшим числом страниц — максимум около 200.
Почему лимит 200 страниц важен для антибота
Это хороший behavioural signal.
Если TrafficVeil видит:
User-Agent: SMTBot
50–150 публичных страниц
умеренная скорость
стабильная инфраструктура
такое поведение хорошо согласуется с официальным профилем.
Но если тот же UA делает:
50 000 URL
/.env
/.git/config
/wp-login.php
/phpmyadmin/
/backup.zip
это уже плохо соответствует назначению официального SMTBot.
Как выглядит User-Agent SMTBot
Самый известный вариант:
Mozilla/5.0 (compatible; SMTBot/1.0; +http://www.similartech.com/smtbot)
Исторически наблюдались и browser-like варианты:
Mozilla/5.0 (Windows NT 10.0; Win64; x64)
AppleWebKit/537.36 (KHTML, like Gecko)
Chrome/94.0.4606.81 Safari/537.36
(compatible; SMTBot/1.0; +http://www.similartech.com/smtbot)
Такие строки фиксируются независимыми каталогами User-Agent.
Для обнаружения лучше использовать устойчивый токен:
SMTBot
а не точную версию Chrome или платформы.
Как найти SMTBot в access.log
Базовый поиск:
grep -i "SMTBot" /var/log/nginx/access.log
Количество запросов:
grep -ic "SMTBot" /var/log/nginx/access.log
Топ URL:
grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Как проверить глубину обхода
Так как SimilarTech сам указывает предел около 200 страниц, полезно посчитать число уникальных URL.
grep -i "SMTBot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort -u \
| wc -l
Если один сеанс SMTBot стабильно уходит далеко за несколько сотен уникальных страниц, TrafficVeil может повышать anomaly score.
Можно ли доверять одному User-Agent
Нет.
Даже у легитимного и документированного crawler User-Agent остаётся обычным HTTP-заголовком.
Любой клиент может написать:
User-Agent: Mozilla/5.0 (compatible; SMTBot/1.0;
+http://www.similartech.com/smtbot)
Поэтому TrafficVeil не должен автоматически выдавать Trusted Allow только по совпадению имени.
Как TrafficVeil должен проверять SMTBot
Лучше использовать несколько признаков одновременно:
- UA;
- IP;
- ASN;
- ASN organization;
- network type;
- TLS fingerprint;
- HTTP fingerprint;
- глубину обхода;
- частоту;
- типы запрашиваемых URL;
- историю предыдущих визитов.
Официального IP feed нет
На официальной странице SMTBot SimilarTech не публикует компактный список IP или JSON feed для верификации crawler. Страница описывает назначение, глубину и robots.txt, но не предоставляет IP-ranges.
Поэтому IP, увиденные TrafficVeil, лучше разделять на:
| Статус | Значение |
|---|---|
| Observed IP | С адреса наблюдался SMTBot UA |
| Probable IP | Инфраструктура и поведение стабильно совпадают с SMTBot |
| Verified IP | Есть официальное подтверждение оператора |
Соблюдает ли SMTBot robots.txt
Да.
SimilarTech прямо отвечает на этот вопрос в документации: SMTBot следует правилам robots.txt для User-Agent SMTBot.
Полный запрет:
User-agent: SMTBot
Disallow: /
Это должен быть основной первый способ отказаться от crawling SimilarTech.
Частичное ограничение SMTBot
Если владелец сайта не против technology profiling публичной части, но хочет закрыть отдельные области:
User-agent: SMTBot
Disallow: /admin/
Disallow: /account/
Disallow: /checkout/
Disallow: /internal/
Allow: /
Но помнить нужно о стандартном правиле: robots.txt не защищает секретные данные.
robots.txt — не ACL
Даже если SMTBot его соблюдает, закрытые разделы должны защищаться настоящими механизмами авторизации.
Например:
/admin/
/internal-api/
/private/
нельзя считать безопасными только потому, что они находятся в Disallow.
Как заблокировать SMTBot через Nginx
Если требуется принудительный запрет:
if ($http_user_agent ~* "SMTBot") {
return 403;
}
Однако для официального crawler SimilarTech логичнее сначала использовать robots.txt, поскольку его соблюдение подтверждено самим оператором.
Блокировка через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} SMTBot [NC]
RewriteRule ^ - [F,L]
Стоит ли блокировать SMTBot
Зависит от отношения владельца сайта к technology profiling.
SMTBot не является поисковым crawler и не приносит классическую SEO-ценность.
Его польза заключается в другом: технология сайта может быть обнаружена и представлена в данных SimilarTech / связанных technology intelligence продуктах.
Когда имеет смысл Allow
Разрешение может быть нормальным вариантом, если:
- владельцу сайта не мешает technology profiling;
- нагрузка минимальна;
- crawler соответствует ожидаемому профилю;
- технологии сайта и так публично определяются;
- нет требований ограничивать сторонний сбор таких данных.
Когда имеет смысл Block
Блокировка разумна, если:
- владелец не хочет участвовать в базах technology intelligence;
- crawler не приносит бизнес-пользы;
- возникает лишняя нагрузка;
- источник ведёт себя нетипично;
- политика компании ограничивает сторонний автоматизированный profiling.
Нужен ли Rate Limit
Для подтверждённого SMTBot специальный жёсткий Rate Limit обычно не должен быть первым решением.
Официальный crawler уже ограничен собственной focused-моделью и не должен пытаться индексировать сайт целиком.
Если TrafficVeil видит большое количество запросов, сначала стоит проверить:
- действительно ли UA похож на SMTBot;
- сколько уникальных URL;
- не превышает ли профиль заявленные примерно 200 страниц;
- из каких ASN приходит трафик;
- нет ли spoofing;
- что именно запрашивает клиент.
Как оценивать нагрузку SMTBot
По внутренней сводке TrafficVeil наблюдалось порядка 2,1 тыс. запросов. Эту цифру лучше показывать с конкретным периодом измерения, поскольку она является статистикой TrafficVeil, а не глобальным количеством запросов SimilarTech.
Для оценки полезнее сочетать несколько показателей:
| Метрика | Что показывает |
|---|---|
| Requests | Общий объём активности |
| Unique URLs | Глубину focused crawl |
| Unique IP | Размер наблюдаемой инфраструктуры |
| ASN | Сети источников |
| RPS/RPM | Интенсивность |
| Bandwidth | Стоимость трафика |
| Cache HIT | Какая часть не дошла до origin |
| Origin requests | Реальную нагрузку |
Повлияет ли блокировка SMTBot на Google
Нет прямой связи.
SMTBot не является Googlebot.
Отдельное правило:
User-agent: SMTBot
Disallow: /
не блокирует:
Googlebot
Googlebot-Image
AdsBot-Google
Bingbot
YandexBot
Поэтому блокировка SMTBot сама по себе не снимает сайт с обычного поискового индексирования.
SMTBot не является AI crawler
SMTBot также не стоит относить к AI/LLM crawler только потому, что он автоматически анализирует контент.
Официально SimilarTech указывает конкретную функцию:
более точное определение технологий, используемых на сайтах.
Поэтому для TrafficVeil правильнее:
Technology Intelligence
→ Tech Profiling
→ SMTBot
а не:
AI & LLM Crawlers
Как учитывать SMTBot в аналитике
SMTBot — автоматизированный crawler, поэтому его запросы не должны увеличивать число реальных посетителей.
Рекомендуется:
- исключать из Human Traffic;
- не учитывать как конверсию;
- не относить автоматически к вредоносным ботам;
- учитывать отдельно в Technology Intelligence traffic;
- показывать число уникальных URL;
- отслеживать соответствие focused-crawl профилю.
Как определить spoofed SMTBot
| Признак | Официальный профиль | Подозрительный профиль |
|---|---|---|
| Глубина | Небольшое число страниц, максимум около 200 | Тысячи/десятки тысяч URL |
| Цель | Публичные web-страницы | Служебные и секретные файлы |
| Поведение | Focused crawl | Vulnerability scanning |
| UA | Стабильный SMTBot | Название без соответствующего поведения |
| Инфраструктура | Повторяемая | Хаотичная proxy/residential rotation |
Рекомендуемая карточка TrafficVeil
| Поле | Значение |
|---|---|
| Name | SMTBot |
| Operator | SimilarTech |
| Parent ecosystem | Similarweb |
| Category | Technology Intelligence |
| Subtype | Tech Profiling |
| UA | SMTBot/1.0 |
| Crawl model | Focused |
| Max pages | ~200 according to SimilarTech |
| robots.txt | Yes |
| Official IP feed | Not published on bot page |
| Default action | Allow / Monitor |
| Human analytics | Exclude |
| Bot analytics | Include |
Стратегия Allow / Monitor / Block
| Ситуация | Действие |
|---|---|
| Technology profiling не мешает | Allow |
| Нужна только статистика | Monitor |
| Не хотите присутствовать в profiling-базах | Disallow |
| robots.txt не помогает | Block |
| Нагрузка неожиданно высокая | Verify → Rate Limit |
| UA используется для security scanning | Block как spoofing |
Что показывать пользователю TrafficVeil
Вместо общего:
«Легитимный crawler. Решение зависит от бизнес-пользы.»
можно дать более информативное описание:
SMTBot — crawler SimilarTech для определения технологий сайта. Он выполняет focused crawl и по официальной документации получает не более примерно 200 страниц, соблюдая robots.txt. Если вы не хотите, чтобы ваш технологический стек анализировался SimilarTech, crawler можно отключить отдельным правилом.
Итог
SMTBot — легитимный focused crawler SimilarTech для technology profiling. Его задача — не индексировать весь сайт для поисковой выдачи, а получить ограниченное число страниц и определить используемые технологии.
SimilarTech прямо указывает два важных ограничения: SMTBot получает не более примерно 200 страниц и соблюдает robots.txt для User-Agent SMTBot.
Поэтому для TrafficVeil его лучше классифицировать как Technology Intelligence / Tech Profiling со стандартной политикой Allow / Monitor.
Если владелец сайта не хочет участвовать в подобном profiling, первым шагом должен быть Disallow для SMTBot. Если же клиент с таким UA демонстрирует глубокое сканирование, перебирает технические файлы или сильно превышает официальный focused-профиль, TrafficVeil должен проверить spoofing и принимать решение уже по фактическому поведению.
Частые вопросы
Что такое SMTBot?
Кто является оператором SMTBot?
Соблюдает ли SMTBot robots.txt?
Что именно ищет SMTBot?
Повлияет ли блокировка SMTBot на Google?
Нужно ли блокировать SMTBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.