Боты8 мин чтения·12 августа 2026 г.

Brightbot: что это за краулер Bright Data и нужно ли его блокировать

Brightbot — официальный data-collection crawler компании Bright Data с User-Agent Brightbot 1.0 и выделенной подсетью 82.97.199.0/24. Разбираемся, зачем он собирает публичные данные, как проверить настоящий Brightbot, что такое collectors.txt и когда выбирать Allow, Monitor, Rate Limit или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота BrightBot: нежелательный прочие краулеры и сервисы

Brightbot — официальный веб-краулер компании Bright Data, предназначенный для автоматизированного сбора публичных веб-данных.

Сама Bright Data называет Brightbot своим основным data collection crawler и указывает, что он используется как главный pipeline сбора данных для продуктов и сервисов компании.

У Brightbot есть важное преимущество для антибот-систем: оператор публикует не только User-Agent, но и конкретную исходную подсеть.

User-Agent: Brightbot 1.0
IP network: 82.97.199.0/24

Bright Data прямо рекомендует использовать оба признака одновременно для точной идентификации crawler.

Параметр Значение
Название Brightbot
Оператор Bright Data
User-Agent Brightbot 1.0
Исходная подсеть 82.97.199.0/24
Категория Data Collection Crawlers
Назначение Сбор публичных веб-данных для продуктов и сервисов Bright Data
Cache Около 24 часов для предотвращения повторной загрузки одинаковых данных
Webmaster Console Поддерживается
collectors.txt Поддерживается официально
robots.txt Не заявлен столь же явно на актуальной странице Brightbot
TrafficVeil default Monitor

Зачем Brightbot приходит на сайт

Bright Data работает с автоматизированным получением общедоступных интернет-данных. Brightbot является выделенным crawler layer для такого сбора.

Это означает, что появление:

Brightbot 1.0

в access.log не является обычным пользовательским визитом.

Запрос относится к автоматическому получению данных, которое выполняется инфраструктурой Bright Data. Компания прямо называет Brightbot основным data-collection pipeline для своих продуктов и сервисов.

Brightbot — не поисковый робот

Его не следует классифицировать рядом с:

Googlebot
YandexBot
Bingbot

Задача Brightbot — не построение обычного поискового индекса.

Для TrafficVeil более точная структура:

Automated Traffic
→ Data Collection
→ Commercial Data Crawlers
→ Bright Data
→ Brightbot

Как выглядит User-Agent Brightbot

Bright Data официально публикует очень простую строку:

Brightbot 1.0

Поэтому для обнаружения в логах достаточно искать:

Brightbot

Однако для выдачи статуса Verified одного UA недостаточно.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Официальная подсеть Brightbot

Bright Data публикует отдельную исходную сеть:

82.97.199.0/24

Компания прямо пишет, что для точной идентификации Brightbot следует одновременно использовать:

User-Agent = Brightbot 1.0

AND

Source IP ∈ 82.97.199.0/24

Это значительно надёжнее простой UA-сигнатуры.

Как TrafficVeil должен определять настоящий Brightbot

Здесь можно использовать практически детерминированное правило первого уровня:

UA == "Brightbot 1.0"
AND
IP ∈ 82.97.199.0/24
→ Brightbot Verified

Дополнительно TrafficVeil может учитывать:

  • ASN;
  • network organization;
  • TLS fingerprint;
  • HTTP fingerprint;
  • частоту;
  • профиль URL;
  • историю источника.

Но ключевые сигналы уже публикует сам оператор.

Почему одного User-Agent недостаточно

Любой HTTP-клиент способен отправить:

User-Agent: Brightbot 1.0

Поэтому:

UA = Brightbot
IP = случайный residential proxy

не должен автоматически получать trusted policy.

Если IP не входит в официальную сеть, TrafficVeil разумно показывать:

Claimed Brightbot
Verification: Failed

или:

Brightbot UA spoofing

Как найти Brightbot в access.log

Базовый поиск:

grep -i "Brightbot" /var/log/nginx/access.log

Количество запросов:

grep -ic "Brightbot" /var/log/nginx/access.log

Топ URL:

grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

Топ IP:

grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

HTTP-коды:

grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn

Как проверить, что IP входит в официальный /24

Для одного адреса можно сначала посмотреть источник:

IP="82.97.199.132"

whois "$IP"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Но для TrafficVeil лучше выполнять CIDR-проверку непосредственно на уровне классификатора:

82.97.199.0/24

Bright Data называет именно эту подсеть официальным источником Brightbot traffic.

Как выглядит spoofed Brightbot

Самый очевидный вариант:

User-Agent: Brightbot 1.0
IP: 203.0.113.45

где адрес не входит в:

82.97.199.0/24

Такой запрос не проходит опубликованную Bright Data проверку.

Ещё более подозрительный профиль:

User-Agent: Brightbot 1.0

GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.sql
GET /vendor/phpunit/

В таком случае TrafficVeil должен учитывать и сетевую идентичность, и фактическое поведение клиента.

Brightbot использует кеширование

Bright Data заявляет встроенный cache layer, который предотвращает повторное скачивание одинаковых данных в течение примерно 24 часов.

Из этого правила возможны исключения, если для повторного получения существует отдельное business justification.

Упрощённо:

GET /product/123
↓
Brightbot получает страницу
↓
cache
↓
повторная необходимость в тех же данных
↓
используется кеш, если нет причины обновить данные

Почему 24 часа нельзя превращать в жёсткую антибот-сигнатуру

Оператор прямо предусматривает исключения.

Поэтому нельзя использовать правило:

Brightbot повторил URL раньше 24 часов
→ fake bot

Корректнее использовать повторяемость как один из behavioural signals.

Какие URL может получать Brightbot

Фиксированного универсального списка URL нет: конкретные страницы зависят от задач клиентов и продуктов Bright Data.

Поэтому TrafficVeil лучше строить статистику непосредственно по наблюдаемому трафику:

  • Top URLs;
  • Unique URLs;
  • Requests per URL;
  • HTTP methods;
  • Response Size;
  • RPS/RPM;
  • Cache HIT;
  • Origin Impact.

Webmaster Console Bright Data

Bright Data предоставляет отдельный Webmaster Console для владельцев сайтов.

После подтверждения владения доменом через DNS владелец может получать статистику и контролировать параметры collection traffic, направленного на сайт.

В консоли доступны, в частности:

  • domain health;
  • traffic statistics;
  • alert rules;
  • контроль доступа к отдельным типам данных;
  • настройка collectors.txt.

Что такое collectors.txt

collectors.txt — отдельный механизм Bright Data для коммуникации между владельцем сайта и Brightbot.

Bright Data описывает его как configurable resource, через который веб-мастер может сообщить crawler правила и ограничения сбора данных.

Это не просто копия robots.txt.

В collectors.txt можно передавать сведения о:

  • endpoint с персональными данными;
  • private endpoints;
  • интерактивных элементах;
  • advertising links;
  • reviews;
  • copyright status данных.

Bright Data рассматривает эти правила и после утверждения применяет их к Brightbot.

collectors.txt и robots.txt — не одно и то же

Это важный момент для базы TrafficVeil.

Bright Data прямо позиционирует collectors.txt как специализированный механизм для public web data collectors. В Trust Center компания противопоставляет его обычному robots.txt, который исторически ориентирован прежде всего на поисковые crawler.

Поэтому карточка должна выглядеть так:

collectors.txt: Supported
Webmaster Console: Supported
robots.txt compliance: Not explicitly confirmed on Brightbot page

Это точнее, чем просто:

robots.txt: Yes

Как заблокировать Brightbot через robots.txt

Если вы всё же хотите заявить обычную crawler-policy, можно добавить:

User-agent: Brightbot
Disallow: /

Но технический контроль доступа лучше не основывать только на robots.txt, особенно поскольку Bright Data предоставляет собственный collectors.txt и Webmaster Console.

Блокировка по IP через Nginx

Поскольку Bright Data публикует подсеть, можно использовать сетевой запрет:

deny 82.97.199.0/24;

Это блокирует официальный диапазон Brightbot независимо от User-Agent.

Блокировка по User-Agent

if ($http_user_agent ~* "Brightbot") {
    return 403;
}

Но UA-фильтр сам по себе менее надёжен: он блокирует и настоящий crawler, и любой клиент, который просто назвался Brightbot.

Комбинированная идентификация лучше

Для классификации наиболее правильная модель:

UA = Brightbot 1.0
+
IP ∈ 82.97.199.0/24
=
Verified Brightbot

Именно такую проверку фактически рекомендует сама Bright Data.

Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Brightbot [NC]
RewriteRule ^ - [F,L]

Нужно ли блокировать Brightbot по умолчанию

Я бы не ставил ни автоматический Allow, ни автоматический Deny.

Главное различие:

Legitimate bot
≠
Useful bot for every website

Brightbot является хорошо идентифицируемым crawler официального оператора, но его бизнес-ценность для конкретного сайта зависит от политики владельца относительно автоматизированного сбора публичных данных.

Поэтому разумный default для TrafficVeil:

Identity: Verified
Default action: Monitor
Owner choice: Allow / Limit / Block

Почему «не продаёте данные Bright Data — Deny» не совсем правильно

Владелец сайта может вообще не иметь договора или аккаунта Bright Data.

Brightbot является частью инфраструктуры data collection Bright Data, и конкретный запрос может выполняться в рамках продукта или задачи клиента Bright Data.

Поэтому правильный вопрос:

Разрешаете ли вы Bright Data автоматизированно получать публичные данные с вашего сайта?

а не:

«Продаёте ли вы данные Bright Data?»

Когда имеет смысл Allow

Allow разумен, если:

  • владелец не возражает против автоматизированного сбора публичных данных;
  • нагрузка приемлема;
  • источник прошёл UA + IP verification;
  • владелец использует Webmaster Console;
  • правила collectors.txt удовлетворяют требованиям сайта.

Когда имеет смысл Block

Block может быть логичен, если:

  • владелец сайта принципиально не хочет отдавать публичный контент Bright Data;
  • сбор не приносит бизнес-пользы;
  • политика организации запрещает такой data collection;
  • возникает нежелательная нагрузка;
  • нужен технически жёсткий отказ, а не декларативная политика.

Когда нужен Rate Limit

Если Brightbot разрешён, но нагрузка слишком высокая, можно применять Rate Limit.

При этом Bright Data сама заявляет механизм автоматического health monitoring: система отслеживает доступность и latency целевых сайтов и при обнаружении корреляции между своим трафиком и деградацией сайта автоматически устанавливает rate limit.

Но владелец сайта всё равно может применять собственные ограничения на уровне TrafficVeil.

Какие метрики показывать для Brightbot

Метрика Зачем
Requests Общий объём collection traffic
Verified Requests Запросы с правильным UA + IP
Failed Verification Поддельный Brightbot UA
Unique URLs Ширина сбора
Requests per URL Повторные обращения
Bandwidth Объём переданных данных
Cache HIT Сколько запросов не дошло до origin
Origin Requests Реальная нагрузка
RPS/RPM Интенсивность
403/429 Результаты защитных политик

Внутренняя статистика TrafficVeil

Если по сводке TrafficVeil Brightbot дал порядка 1,7 тыс. запросов, эту цифру стоит показывать только вместе с периодом измерения.

Например:

Brightbot
1 704 requests
Period: 30 days
Verified: 98.7%
Origin requests: 412
Cache hit: 75.8%

Такой блок намного полезнее простого числа hits.

Bright Data рекомендует whitelist — нужно ли соглашаться

В собственной документации Bright Data рекомендует владельцам сайтов whitelist Brightbot. Среди аргументов компания называет снижение retry/duplicate requests, отделение collection traffic от пользовательского и возможность более полного контроля через Brightbot.

Но для TrafficVeil это следует показывать именно как позицию оператора, а не универсальную рекомендацию.

Решение владельца сайта может быть другим.

Brightbot и приватные данные

Bright Data заявляет, что по умолчанию считает данные за login приватными, блокирует использование authentication cookies в видимом collection traffic и ограничивает интерактивные действия.

Но это не отменяет базовое правило безопасности:

приватная информация должна быть защищена авторизацией на самом сайте.

robots.txt, collectors.txt или обещания crawler не являются заменой authentication и ACL.

Brightbot и BrightEdge Crawler — разные боты

Из-за названий их легко перепутать.

Параметр Brightbot BrightEdge Crawler
Оператор Bright Data BrightEdge
Назначение Web data collection SEO audit и анализ
UA Brightbot 1.0 BrightEdge - BrightEdge Crawler/1.0
Категория Data Collection SEO Crawler

BrightEdge официально описывает свой crawler как инструмент для Site Audit/Content IQ, on-page recommendations и SearchIQ. Это совершенно другой продукт и оператор.

Повлияет ли блокировка Brightbot на Google

Нет прямой связи.

Brightbot не является Googlebot.

Правило:

deny 82.97.199.0/24;

или:

if ($http_user_agent ~* "Brightbot") {
    return 403;
}

не является блокировкой Googlebot или YandexBot.

Как учитывать Brightbot в аналитике

Brightbot — автоматизированный data-collection traffic.

Для TrafficVeil:

Automated Traffic
→ Data Collection Crawlers
→ Commercial Data Collection
→ Bright Data
→ Brightbot

Запросы следует:

  • исключать из Human Traffic;
  • не считать пользовательскими сессиями;
  • не учитывать как конверсии;
  • не считать malicious при успешной проверке только из-за самого факта crawling;
  • показывать отдельно как collection traffic;
  • разделять Verified и Spoofed Brightbot.

Рекомендуемая карточка TrafficVeil

Поле Значение
Name Brightbot
Operator Bright Data
Category Data Collection Crawlers
Subtype Commercial Web Data Collection
User-Agent Brightbot 1.0
Official network 82.97.199.0/24
Verification UA + source IP
Identity Verified when both match
Cache ~24h, with documented exceptions
Webmaster Console Supported
collectors.txt Supported
robots.txt Not explicitly confirmed on current Brightbot page
Default action Monitor
Human analytics Exclude
Collection analytics Include

Стратегия Allow / Monitor / Rate Limit / Block

Ситуация Рекомендация
UA + IP подтверждены, сбор разрешён Allow
Brightbot подтверждён, политика ещё не определена Monitor
Нужен контроль отдельных endpoint Webmaster Console + collectors.txt
Сбор допустим, но мешает origin Rate Limit
Не хотите отдавать публичные данные Bright Data Block
UA совпадает, IP вне 82.97.199.0/24 Failed verification / inspect
Под UA Brightbot идёт vulnerability scanning Block / reclassify

Что показывать пользователю TrafficVeil

Вместо:

«Brightbot — легитимный сервис. Разрешайте, если он вам нужен.»

лучше показать:

Brightbot — официальный crawler Bright Data для автоматизированного сбора публичных веб-данных. Настоящий Brightbot определяется одновременно по User-Agent Brightbot 1.0 и подсети 82.97.199.0/24. Bright Data также предоставляет Webmaster Console и collectors.txt для управления сбором. Если вы не хотите предоставлять данные этому crawler, его можно заблокировать отдельно, не затрагивая Googlebot и другие поисковые системы.

Итог

Brightbot — хорошо документированный data-collection crawler Bright Data. В отличие от множества малоизвестных ботов его можно достаточно надёжно идентифицировать: Bright Data официально публикует и User-Agent Brightbot 1.0, и исходную сеть 82.97.199.0/24, рекомендуя использовать оба признака одновременно.

Bright Data также заявляет встроенный cache примерно на 24 часа, систему автоматического мониторинга влияния трафика на сайты, Webmaster Console и собственный механизм collectors.txt для управления data collection.

Поэтому для TrafficVeil я бы классифицировал его как:

Data Collection Crawlers
→ Commercial Web Data Collection
→ Bright Data
→ Brightbot

Identity: Verified by UA + IP
Default: Monitor

И главное — не смешивать легитимность и желательность. Brightbot может быть полностью настоящим и технически подтверждённым crawler, но владелец сайта всё равно вправе не хотеть автоматизированного сбора своих публичных данных. В таком случае TrafficVeil должен дать понятный выбор между Allow, Monitor, collectors.txt, Rate Limit и Block.

Частые вопросы

Что такое Brightbot?
Brightbot — официальный crawler Bright Data. Компания называет его основным data-collection pipeline для своих продуктов и сервисов. Для идентификации используются User-Agent Brightbot 1.0 и исходная подсеть 82.97.199.0/24.
Как проверить настоящий Brightbot?
Bright Data рекомендует одновременно проверять оба признака: UA Brightbot 1.0 и IP, входящий в 82.97.199.0/24. Совпадение только User-Agent недостаточно, потому что UA легко подделать.
Как часто Brightbot повторно скачивает одну страницу?
Bright Data заявляет встроенный cache layer, который предотвращает повторную загрузку одинаковых данных примерно в течение 24 часов, кроме случаев, когда для исключения существует отдельное бизнес-обоснование.
Что такое collectors.txt?
Это механизм Bright Data для владельцев сайтов. Через Webmaster Console можно определить правила сбора: отметить endpoint с PII, интерактивные элементы, приватные зоны и сведения об авторских правах. После проверки Bright Data утверждённые правила применяются Brightbot.
Соблюдает ли Brightbot robots.txt?
На актуальной официальной странице Brightbot основной документированный механизм контроля — collectors.txt; явного обещания соблюдать стандартный robots.txt на этой странице нет. Поэтому для TrafficVeil я бы хранил robots.txt compliance: Not explicitly documented, а collectors.txt: Supported.
Чем Brightbot отличается от BrightEdge Crawler?
Это разные боты разных компаний. Brightbot принадлежит Bright Data и предназначен для data collection. BrightEdge Crawler принадлежит SEO-платформе BrightEdge и используется для Site Audit, ContentIQ, рекомендаций и SEO-анализа; его официальный UA — BrightEdge - BrightEdge Crawler/1.0 (crawler@brightedge.com).
#Brightbot#Bright Data#Brightbot crawler#data collection crawler#web scraping#collectors.txt#Webmaster Console#User-Agent#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil