Боты5 мин чтения·25 августа 2026 г.

HubSpot в логах: чей это краулер сканирует ваш сайт

Токен hubspot в access.log — не обязательно ваша интеграция, а след одного из фирменных ботов HubSpot, запущенного по инициативе стороннего пользователя сервиса. Разбираем разницу между краулером и клиентским трекингом, как найти бота в логах и настроить allow, rate-limit или блокировку через TrafficVeil.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота HubSpot: легитимный прочие краулеры и сервисы

HubSpot знают почти все — крупный сервис маркетинга, продаж и CRM с миллионами пользователей по всему миру. Но появление токена hubspot в access.log вашего сайта далеко не всегда означает, что кто-то из вашей команды подключил именно этот сервис: чаще это след одного из фирменных ботов HubSpot, которые запускаются по инициативе стороннего пользователя платформы. В каталоге TrafficVeil бот отмечен как легитимный в категории «Прочие краулеры и сервисы».

Что такое HubSpot-бот на самом деле

Официально HubSpot задокументировал как минимум два разных краулера с собственными user-agent: HubSpot Crawler — для SEO-инструментов, которые сканируют указанный URL, и HubSpotContentSearchBot — отдельный агент для функции поиска по сайту, если клиент HubSpot использует их модуль site search. По данным сторонних каталогов ботов, всего у HubSpot насчитывается около полудюжины разных ботов, каждый со своим UA, который можно разрешать или блокировать независимо от остальных.

Важная деталь, которую часто путают: клиентский трекинг HubSpot — формы, чат-виджет, marketing automation — работает через JavaScript-скрипт прямо в браузере реального посетителя сайта, и в access.log такой визит выглядит как обычная сессия человека, а не как отдельный бот. Токен hubspot в UA относится именно к серверным краулерам, а не к этому клиентскому трекингу.

Параметр Значение
Название HubSpot Crawler / HubSpotContentSearchBot
User-Agent / паттерн hubspot (полная строка одного из ботов: HubSpot Crawler 1.0)
Оператор HubSpot, Inc. — известная компания, разработчик одноимённого сервиса
Роль HubSpot Crawler — сканирование URL по запросу пользователя SEO-инструментов; HubSpotContentSearchBot — индексация для функции поиска по сайту клиента
Документация / ориентир Официальная документация HubSpot по SEO-инструментам и robots.txt
Список IP ❌ Отдельного публичного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Официально подтверждённое правило: User-agent: HubSpot Crawler / Disallow: /
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем HubSpot-бот приходит на сайт

Ключевой вопрос здесь не «зачем боту вообще нужен сайт», а «чей это HubSpot-аккаунт». Если ваш сайт не работает на HubSpot и никто из команды не запускал их SEO-инструменты, скорее всего, кто-то другой — например, компания, изучающая вашу нишу как конкурент, или партнёр, проверяющий партнёрскую ссылку, — ввёл ваш URL в свои HubSpot-инструменты сканирования. Это не редкость: HubSpot Crawler запускается по запросу любого пользователя платформы, а не только владельца целевого домена.

Типичный сигнал для диагностики: CDN-трафик подрастает, origin CPU занят вычиткой HTML, а фильтр по hubspot показывает обход публичных URL, иногда открытого API и статики — без какой-либо связи с формами или чатом на вашем сайте, потому что тех у вас может и не быть вовсе.

Нагрузка и риски именно для HubSpot-бота

Отдельной строки в публичной сводке топ-ботов TrafficVeil у hubspot может не быть, но для категории «Прочие краулеры и сервисы» характерен один и тот же фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на качество хитов:

  • глубину обхода — повторы одних и тех же URL или систематический проход по разделам;
  • отсутствие cookie и признаков сессии;
  • концентрацию на служебных или, наоборот, самых «листовых» страницах.
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти HubSpot-бота в логах

Не ищите «просто ботов» — ищите конкретный токен hubspot и сразу смотрите соседей по семейству, поскольку под этим именем скрывается сразу несколько разных инструментов.

# Базовый поиск
grep -i "hubspot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: официального списка IP у HubSpot не публикуется, поэтому подделать UA технически может любой скрипт. Смотрите связку UA + ASN/IP + частота + набор URL. Единичный проход по паре URL, не связанных с известными вам партнёрами, — типичный признак стороннего сканирования, а не собственной интеграции.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для HubSpot

# Жёсткий запрет
User-agent: hubspot
Disallow: /

# Разрешить всё
User-agent: hubspot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: hubspot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важная деталь: если ваш сайт использует функцию site search на HubSpot, отдельно нужно разрешить именно HubSpotContentSearchBot — иначе поиск по сайту перестанет корректно индексировать страницы. Общее правило по токену hubspot не всегда покрывает это исключение, поэтому для клиентов HubSpot стоит прописывать правила по каждому боту отдельно.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "hubspot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=hubspot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "hubspot") {
        limit_req zone=hubspot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} hubspot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите hubspot / HubSpot в ботах домена или в /system/bots;
  • для нежелательного сценария — категория «запретить»; для мягкого — rate-limit;
  • allow оставляйте только если сайт действительно интегрирован с HubSpot и использует, например, их site search;
  • после изменения сверьте логи: хиты HubSpot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать HubSpot

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для HubSpot

Ситуация Действие
Сайт сам работает на HubSpot или использует их site search Allow нужным ботам семейства + закрыть /admin /cart /api
Сайт с HubSpot никак не связан Disallow + запрет в TrafficVeil
Обход в целом приемлем, но частота избыточна Rate-limit на nginx/TrafficVeil
Непонятно, чей это HubSpot-аккаунт просканировал сайт Deny по умолчанию, исключения — точечно
Подозрение на спуфинг UA Не доверять строке UA; смотреть IP/ASN и поведение

Главный вывод по HubSpot: сам факт визита не означает, что это ваш инструмент. Прежде чем решать между allow и запретом, стоит понять, работает ли сайт с HubSpot вообще, — и уже от этого отталкиваться, а не от одной узнаваемой строки в логах.

Частые вопросы

Означает ли визит HubSpot-бота, что сайт интегрирован с этим сервисом?
Нет — краулер часто запускается по инициативе стороннего пользователя HubSpot, который просто ввёл ваш URL в свои SEO-инструменты, а не владельцем сайта.
Чем HubSpot Crawler отличается от клиентского трекинга форм и чата?
Трекинг работает через JavaScript в браузере реального посетителя и выглядит в логах как обычная сессия, а не как отдельный бот с UA hubspot.
Почему для сайтов на HubSpot важно не блокировать все боты этого семейства огулом?
Потому что за токеном hubspot скрывается около полудюжины разных ботов, и, например, блокировка HubSpotContentSearchBot сломает встроенный поиск по сайту.
Можно ли доверять robots.txt для контроля HubSpot Crawler?
Да, для основного краулера есть официально подтверждённое правило блокировки, но действует оно только на этого конкретного бота, а не на всё семейство сразу.
Что делать, если сайт никак не связан с HubSpot, а бот всё равно заходит?
Стоит спокойно ограничить доступ через robots.txt или TrafficVeil — если интеграции нет, влияния на SEO или видимость сайта это не окажет.
Как проверить в логах, что это не подделанный под HubSpot трафик?
Смотреть не только на строку UA, но и на связку IP/ASN с поведением — официального списка IP у HubSpot не публикуется, поэтому одного заголовка недостаточно.
#HubSpot#HubSpot Crawler#боты на сайте#CRM-сервисы#robots.txt#защита от ботов#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil