TrafficVeil
Боты 5 мин25 августа 2026 г.

HubSpot в логах: чей это краулер сканирует ваш сайт

Токен hubspot в access.log — не обязательно ваша интеграция, а след одного из фирменных ботов HubSpot, запущенного по инициативе стороннего пользователя сервиса. Разбираем разницу между краулером и клиентским трекингом, как найти бота в логах и настроить allow, rate-limit или блокировку через TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое HubSpot-бот на самом деле
  2. Зачем HubSpot-бот приходит на сайт
  3. Нагрузка и риски именно для HubSpot-бота
  4. Как найти HubSpot-бота в логах
  5. robots.txt для HubSpot
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать HubSpot
  11. Стратегия allow/deny для HubSpot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

HubSpot знают почти все — крупный сервис маркетинга, продаж и CRM с миллионами пользователей по всему миру. Но появление токена hubspot в access.log вашего сайта далеко не всегда означает, что кто-то из вашей команды подключил именно этот сервис: чаще это след одного из фирменных ботов HubSpot, которые запускаются по инициативе стороннего пользователя платформы. В каталоге TrafficVeil бот отмечен как легитимный в категории «Прочие краулеры и сервисы».

Что такое HubSpot-бот на самом деле

Официально HubSpot задокументировал как минимум два разных краулера с собственными user-agent: HubSpot Crawler — для SEO-инструментов, которые сканируют указанный URL, и HubSpotContentSearchBot — отдельный агент для функции поиска по сайту, если клиент HubSpot использует их модуль site search. По данным сторонних каталогов ботов, всего у HubSpot насчитывается около полудюжины разных ботов, каждый со своим UA, который можно разрешать или блокировать независимо от остальных.

Важная деталь, которую часто путают: клиентский трекинг HubSpot — формы, чат-виджет, marketing automation — работает через JavaScript-скрипт прямо в браузере реального посетителя сайта, и в access.log такой визит выглядит как обычная сессия человека, а не как отдельный бот. Токен hubspot в UA относится именно к серверным краулерам, а не к этому клиентскому трекингу.

Параметр Значение
Название HubSpot Crawler / HubSpotContentSearchBot
User-Agent / паттерн hubspot (полная строка одного из ботов: HubSpot Crawler 1.0)
Оператор HubSpot, Inc. — известная компания, разработчик одноимённого сервиса
Роль HubSpot Crawler — сканирование URL по запросу пользователя SEO-инструментов; HubSpotContentSearchBot — индексация для функции поиска по сайту клиента
Документация / ориентир Официальная документация HubSpot по SEO-инструментам и robots.txt
Список IP ❌ Отдельного публичного списка IP не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Официально подтверждённое правило: User-agent: HubSpot Crawler / Disallow: /
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем HubSpot-бот приходит на сайт

Ключевой вопрос здесь не «зачем боту вообще нужен сайт», а «чей это HubSpot-аккаунт». Если ваш сайт не работает на HubSpot и никто из команды не запускал их SEO-инструменты, скорее всего, кто-то другой — например, компания, изучающая вашу нишу как конкурент, или партнёр, проверяющий партнёрскую ссылку, — ввёл ваш URL в свои HubSpot-инструменты сканирования. Это не редкость: HubSpot Crawler запускается по запросу любого пользователя платформы, а не только владельца целевого домена.

Типичный сигнал для диагностики: CDN-трафик подрастает, origin CPU занят вычиткой HTML, а фильтр по hubspot показывает обход публичных URL, иногда открытого API и статики — без какой-либо связи с формами или чатом на вашем сайте, потому что тех у вас может и не быть вовсе.

Нагрузка и риски именно для HubSpot-бота

Отдельной строки в публичной сводке топ-ботов TrafficVeil у hubspot может не быть, но для категории «Прочие краулеры и сервисы» характерен один и тот же фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на качество хитов:

  • глубину обхода — повторы одних и тех же URL или систематический проход по разделам;
  • отсутствие cookie и признаков сессии;
  • концентрацию на служебных или, наоборот, самых «листовых» страницах.

Как найти HubSpot-бота в логах

Не ищите «просто ботов» — ищите конкретный токен hubspot и сразу смотрите соседей по семейству, поскольку под этим именем скрывается сразу несколько разных инструментов.

# Базовый поиск
grep -i "hubspot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "hubspot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: официального списка IP у HubSpot не публикуется, поэтому подделать UA технически может любой скрипт. Смотрите связку UA + ASN/IP + частота + набор URL. Единичный проход по паре URL, не связанных с известными вам партнёрами, — типичный признак стороннего сканирования, а не собственной интеграции.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для HubSpot

# Жёсткий запрет
User-agent: hubspot
Disallow: /

# Разрешить всё
User-agent: hubspot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: hubspot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важная деталь: если ваш сайт использует функцию site search на HubSpot, отдельно нужно разрешить именно HubSpotContentSearchBot — иначе поиск по сайту перестанет корректно индексировать страницы. Общее правило по токену hubspot не всегда покрывает это исключение, поэтому для клиентов HubSpot стоит прописывать правила по каждому боту отдельно.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "hubspot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=hubspot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "hubspot") {
        limit_req zone=hubspot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} hubspot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите hubspot / HubSpot в ботах домена или в /system/bots;
  • для нежелательного сценария — категория «запретить»; для мягкого — rate-limit;
  • allow оставляйте только если сайт действительно интегрирован с HubSpot и использует, например, их site search;
  • после изменения сверьте логи: хиты HubSpot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать HubSpot

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для HubSpot

Ситуация Действие
Сайт сам работает на HubSpot или использует их site search Allow нужным ботам семейства + закрыть /admin /cart /api
Сайт с HubSpot никак не связан Disallow + запрет в TrafficVeil
Обход в целом приемлем, но частота избыточна Rate-limit на nginx/TrafficVeil
Непонятно, чей это HubSpot-аккаунт просканировал сайт Deny по умолчанию, исключения — точечно
Подозрение на спуфинг UA Не доверять строке UA; смотреть IP/ASN и поведение

Главный вывод по HubSpot: сам факт визита не означает, что это ваш инструмент. Прежде чем решать между allow и запретом, стоит понять, работает ли сайт с HubSpot вообще, — и уже от этого отталкиваться, а не от одной узнаваемой строки в логах.

Частые вопросы

Означает ли визит HubSpot-бота, что сайт интегрирован с этим сервисом?

Нет — краулер часто запускается по инициативе стороннего пользователя HubSpot, который просто ввёл ваш URL в свои SEO-инструменты, а не владельцем сайта.

Чем HubSpot Crawler отличается от клиентского трекинга форм и чата?

Трекинг работает через JavaScript в браузере реального посетителя и выглядит в логах как обычная сессия, а не как отдельный бот с UA hubspot.

Почему для сайтов на HubSpot важно не блокировать все боты этого семейства огулом?

Потому что за токеном hubspot скрывается около полудюжины разных ботов, и, например, блокировка HubSpotContentSearchBot сломает встроенный поиск по сайту.

Можно ли доверять robots.txt для контроля HubSpot Crawler?

Да, для основного краулера есть официально подтверждённое правило блокировки, но действует оно только на этого конкретного бота, а не на всё семейство сразу.

Что делать, если сайт никак не связан с HubSpot, а бот всё равно заходит?

Стоит спокойно ограничить доступ через robots.txt или TrafficVeil — если интеграции нет, влияния на SEO или видимость сайта это не окажет.

Как проверить в логах, что это не подделанный под HubSpot трафик?

Смотреть не только на строку UA, но и на связку IP/ASN с поведением — официального списка IP у HubSpot не публикуется, поэтому одного заголовка недостаточно.

#HubSpot#HubSpot Crawler#боты на сайте#CRM-сервисы#robots.txt#защита от ботов#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

6 мин

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

HubSpot Crawler: кто и зачем сканирует сайт