Brightbot — официальный веб-краулер компании Bright Data, предназначенный для автоматизированного сбора публичных веб-данных.
Сама Bright Data называет Brightbot своим основным data collection crawler и указывает, что он используется как главный pipeline сбора данных для продуктов и сервисов компании.
У Brightbot есть важное преимущество для антибот-систем: оператор публикует не только User-Agent, но и конкретную исходную подсеть.
User-Agent: Brightbot 1.0
IP network: 82.97.199.0/24
Bright Data прямо рекомендует использовать оба признака одновременно для точной идентификации crawler.
| Параметр | Значение |
|---|---|
| Название | Brightbot |
| Оператор | Bright Data |
| User-Agent | Brightbot 1.0 |
| Исходная подсеть | 82.97.199.0/24 |
| Категория | Data Collection Crawlers |
| Назначение | Сбор публичных веб-данных для продуктов и сервисов Bright Data |
| Cache | Около 24 часов для предотвращения повторной загрузки одинаковых данных |
| Webmaster Console | Поддерживается |
| collectors.txt | Поддерживается официально |
| robots.txt | Не заявлен столь же явно на актуальной странице Brightbot |
| TrafficVeil default | Monitor |
Зачем Brightbot приходит на сайт
Bright Data работает с автоматизированным получением общедоступных интернет-данных. Brightbot является выделенным crawler layer для такого сбора.
Это означает, что появление:
Brightbot 1.0
в access.log не является обычным пользовательским визитом.
Запрос относится к автоматическому получению данных, которое выполняется инфраструктурой Bright Data. Компания прямо называет Brightbot основным data-collection pipeline для своих продуктов и сервисов.
Brightbot — не поисковый робот
Его не следует классифицировать рядом с:
Googlebot
YandexBot
Bingbot
Задача Brightbot — не построение обычного поискового индекса.
Для TrafficVeil более точная структура:
Automated Traffic
→ Data Collection
→ Commercial Data Crawlers
→ Bright Data
→ Brightbot
Как выглядит User-Agent Brightbot
Bright Data официально публикует очень простую строку:
Brightbot 1.0
Поэтому для обнаружения в логах достаточно искать:
Brightbot
Однако для выдачи статуса Verified одного UA недостаточно.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Официальная подсеть Brightbot
Bright Data публикует отдельную исходную сеть:
82.97.199.0/24
Компания прямо пишет, что для точной идентификации Brightbot следует одновременно использовать:
User-Agent = Brightbot 1.0
AND
Source IP ∈ 82.97.199.0/24
Это значительно надёжнее простой UA-сигнатуры.
Как TrafficVeil должен определять настоящий Brightbot
Здесь можно использовать практически детерминированное правило первого уровня:
UA == "Brightbot 1.0"
AND
IP ∈ 82.97.199.0/24
→ Brightbot Verified
Дополнительно TrafficVeil может учитывать:
- ASN;
- network organization;
- TLS fingerprint;
- HTTP fingerprint;
- частоту;
- профиль URL;
- историю источника.
Но ключевые сигналы уже публикует сам оператор.
Почему одного User-Agent недостаточно
Любой HTTP-клиент способен отправить:
User-Agent: Brightbot 1.0
Поэтому:
UA = Brightbot
IP = случайный residential proxy
не должен автоматически получать trusted policy.
Если IP не входит в официальную сеть, TrafficVeil разумно показывать:
Claimed Brightbot
Verification: Failed
или:
Brightbot UA spoofing
Как найти Brightbot в access.log
Базовый поиск:
grep -i "Brightbot" /var/log/nginx/access.log
Количество запросов:
grep -ic "Brightbot" /var/log/nginx/access.log
Топ URL:
grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "Brightbot" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Как проверить, что IP входит в официальный /24
Для одного адреса можно сначала посмотреть источник:
IP="82.97.199.132"
whois "$IP"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Но для TrafficVeil лучше выполнять CIDR-проверку непосредственно на уровне классификатора:
82.97.199.0/24
Bright Data называет именно эту подсеть официальным источником Brightbot traffic.
Как выглядит spoofed Brightbot
Самый очевидный вариант:
User-Agent: Brightbot 1.0
IP: 203.0.113.45
где адрес не входит в:
82.97.199.0/24
Такой запрос не проходит опубликованную Bright Data проверку.
Ещё более подозрительный профиль:
User-Agent: Brightbot 1.0
GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.sql
GET /vendor/phpunit/
В таком случае TrafficVeil должен учитывать и сетевую идентичность, и фактическое поведение клиента.
Brightbot использует кеширование
Bright Data заявляет встроенный cache layer, который предотвращает повторное скачивание одинаковых данных в течение примерно 24 часов.
Из этого правила возможны исключения, если для повторного получения существует отдельное business justification.
Упрощённо:
GET /product/123
↓
Brightbot получает страницу
↓
cache
↓
повторная необходимость в тех же данных
↓
используется кеш, если нет причины обновить данные
Почему 24 часа нельзя превращать в жёсткую антибот-сигнатуру
Оператор прямо предусматривает исключения.
Поэтому нельзя использовать правило:
Brightbot повторил URL раньше 24 часов
→ fake bot
Корректнее использовать повторяемость как один из behavioural signals.
Какие URL может получать Brightbot
Фиксированного универсального списка URL нет: конкретные страницы зависят от задач клиентов и продуктов Bright Data.
Поэтому TrafficVeil лучше строить статистику непосредственно по наблюдаемому трафику:
- Top URLs;
- Unique URLs;
- Requests per URL;
- HTTP methods;
- Response Size;
- RPS/RPM;
- Cache HIT;
- Origin Impact.
Webmaster Console Bright Data
Bright Data предоставляет отдельный Webmaster Console для владельцев сайтов.
После подтверждения владения доменом через DNS владелец может получать статистику и контролировать параметры collection traffic, направленного на сайт.
В консоли доступны, в частности:
- domain health;
- traffic statistics;
- alert rules;
- контроль доступа к отдельным типам данных;
- настройка collectors.txt.
Что такое collectors.txt
collectors.txt — отдельный механизм Bright Data для коммуникации между владельцем сайта и Brightbot.
Bright Data описывает его как configurable resource, через который веб-мастер может сообщить crawler правила и ограничения сбора данных.
Это не просто копия robots.txt.
В collectors.txt можно передавать сведения о:
- endpoint с персональными данными;
- private endpoints;
- интерактивных элементах;
- advertising links;
- reviews;
- copyright status данных.
Bright Data рассматривает эти правила и после утверждения применяет их к Brightbot.
collectors.txt и robots.txt — не одно и то же
Это важный момент для базы TrafficVeil.
Bright Data прямо позиционирует collectors.txt как специализированный механизм для public web data collectors. В Trust Center компания противопоставляет его обычному robots.txt, который исторически ориентирован прежде всего на поисковые crawler.
Поэтому карточка должна выглядеть так:
collectors.txt: Supported
Webmaster Console: Supported
robots.txt compliance: Not explicitly confirmed on Brightbot page
Это точнее, чем просто:
robots.txt: Yes
Как заблокировать Brightbot через robots.txt
Если вы всё же хотите заявить обычную crawler-policy, можно добавить:
User-agent: Brightbot
Disallow: /
Но технический контроль доступа лучше не основывать только на robots.txt, особенно поскольку Bright Data предоставляет собственный collectors.txt и Webmaster Console.
Блокировка по IP через Nginx
Поскольку Bright Data публикует подсеть, можно использовать сетевой запрет:
deny 82.97.199.0/24;
Это блокирует официальный диапазон Brightbot независимо от User-Agent.
Блокировка по User-Agent
if ($http_user_agent ~* "Brightbot") {
return 403;
}
Но UA-фильтр сам по себе менее надёжен: он блокирует и настоящий crawler, и любой клиент, который просто назвался Brightbot.
Комбинированная идентификация лучше
Для классификации наиболее правильная модель:
UA = Brightbot 1.0
+
IP ∈ 82.97.199.0/24
=
Verified Brightbot
Именно такую проверку фактически рекомендует сама Bright Data.
Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Brightbot [NC]
RewriteRule ^ - [F,L]
Нужно ли блокировать Brightbot по умолчанию
Я бы не ставил ни автоматический Allow, ни автоматический Deny.
Главное различие:
Legitimate bot
≠
Useful bot for every website
Brightbot является хорошо идентифицируемым crawler официального оператора, но его бизнес-ценность для конкретного сайта зависит от политики владельца относительно автоматизированного сбора публичных данных.
Поэтому разумный default для TrafficVeil:
Identity: Verified
Default action: Monitor
Owner choice: Allow / Limit / Block
Почему «не продаёте данные Bright Data — Deny» не совсем правильно
Владелец сайта может вообще не иметь договора или аккаунта Bright Data.
Brightbot является частью инфраструктуры data collection Bright Data, и конкретный запрос может выполняться в рамках продукта или задачи клиента Bright Data.
Поэтому правильный вопрос:
Разрешаете ли вы Bright Data автоматизированно получать публичные данные с вашего сайта?
а не:
«Продаёте ли вы данные Bright Data?»
Когда имеет смысл Allow
Allow разумен, если:
- владелец не возражает против автоматизированного сбора публичных данных;
- нагрузка приемлема;
- источник прошёл UA + IP verification;
- владелец использует Webmaster Console;
- правила collectors.txt удовлетворяют требованиям сайта.
Когда имеет смысл Block
Block может быть логичен, если:
- владелец сайта принципиально не хочет отдавать публичный контент Bright Data;
- сбор не приносит бизнес-пользы;
- политика организации запрещает такой data collection;
- возникает нежелательная нагрузка;
- нужен технически жёсткий отказ, а не декларативная политика.
Когда нужен Rate Limit
Если Brightbot разрешён, но нагрузка слишком высокая, можно применять Rate Limit.
При этом Bright Data сама заявляет механизм автоматического health monitoring: система отслеживает доступность и latency целевых сайтов и при обнаружении корреляции между своим трафиком и деградацией сайта автоматически устанавливает rate limit.
Но владелец сайта всё равно может применять собственные ограничения на уровне TrafficVeil.
Какие метрики показывать для Brightbot
| Метрика | Зачем |
|---|---|
| Requests | Общий объём collection traffic |
| Verified Requests | Запросы с правильным UA + IP |
| Failed Verification | Поддельный Brightbot UA |
| Unique URLs | Ширина сбора |
| Requests per URL | Повторные обращения |
| Bandwidth | Объём переданных данных |
| Cache HIT | Сколько запросов не дошло до origin |
| Origin Requests | Реальная нагрузка |
| RPS/RPM | Интенсивность |
| 403/429 | Результаты защитных политик |
Внутренняя статистика TrafficVeil
Если по сводке TrafficVeil Brightbot дал порядка 1,7 тыс. запросов, эту цифру стоит показывать только вместе с периодом измерения.
Например:
Brightbot
1 704 requests
Period: 30 days
Verified: 98.7%
Origin requests: 412
Cache hit: 75.8%
Такой блок намного полезнее простого числа hits.
Bright Data рекомендует whitelist — нужно ли соглашаться
В собственной документации Bright Data рекомендует владельцам сайтов whitelist Brightbot. Среди аргументов компания называет снижение retry/duplicate requests, отделение collection traffic от пользовательского и возможность более полного контроля через Brightbot.
Но для TrafficVeil это следует показывать именно как позицию оператора, а не универсальную рекомендацию.
Решение владельца сайта может быть другим.
Brightbot и приватные данные
Bright Data заявляет, что по умолчанию считает данные за login приватными, блокирует использование authentication cookies в видимом collection traffic и ограничивает интерактивные действия.
Но это не отменяет базовое правило безопасности:
приватная информация должна быть защищена авторизацией на самом сайте.
robots.txt, collectors.txt или обещания crawler не являются заменой authentication и ACL.
Brightbot и BrightEdge Crawler — разные боты
Из-за названий их легко перепутать.
| Параметр | Brightbot | BrightEdge Crawler |
|---|---|---|
| Оператор | Bright Data | BrightEdge |
| Назначение | Web data collection | SEO audit и анализ |
| UA | Brightbot 1.0 |
BrightEdge - BrightEdge Crawler/1.0 |
| Категория | Data Collection | SEO Crawler |
BrightEdge официально описывает свой crawler как инструмент для Site Audit/Content IQ, on-page recommendations и SearchIQ. Это совершенно другой продукт и оператор.
Повлияет ли блокировка Brightbot на Google
Нет прямой связи.
Brightbot не является Googlebot.
Правило:
deny 82.97.199.0/24;
или:
if ($http_user_agent ~* "Brightbot") {
return 403;
}
не является блокировкой Googlebot или YandexBot.
Как учитывать Brightbot в аналитике
Brightbot — автоматизированный data-collection traffic.
Для TrafficVeil:
Automated Traffic
→ Data Collection Crawlers
→ Commercial Data Collection
→ Bright Data
→ Brightbot
Запросы следует:
- исключать из Human Traffic;
- не считать пользовательскими сессиями;
- не учитывать как конверсии;
- не считать malicious при успешной проверке только из-за самого факта crawling;
- показывать отдельно как collection traffic;
- разделять Verified и Spoofed Brightbot.
Рекомендуемая карточка TrafficVeil
| Поле | Значение |
|---|---|
| Name | Brightbot |
| Operator | Bright Data |
| Category | Data Collection Crawlers |
| Subtype | Commercial Web Data Collection |
| User-Agent | Brightbot 1.0 |
| Official network | 82.97.199.0/24 |
| Verification | UA + source IP |
| Identity | Verified when both match |
| Cache | ~24h, with documented exceptions |
| Webmaster Console | Supported |
| collectors.txt | Supported |
| robots.txt | Not explicitly confirmed on current Brightbot page |
| Default action | Monitor |
| Human analytics | Exclude |
| Collection analytics | Include |
Стратегия Allow / Monitor / Rate Limit / Block
| Ситуация | Рекомендация |
|---|---|
| UA + IP подтверждены, сбор разрешён | Allow |
| Brightbot подтверждён, политика ещё не определена | Monitor |
| Нужен контроль отдельных endpoint | Webmaster Console + collectors.txt |
| Сбор допустим, но мешает origin | Rate Limit |
| Не хотите отдавать публичные данные Bright Data | Block |
| UA совпадает, IP вне 82.97.199.0/24 | Failed verification / inspect |
| Под UA Brightbot идёт vulnerability scanning | Block / reclassify |
Что показывать пользователю TrafficVeil
Вместо:
«Brightbot — легитимный сервис. Разрешайте, если он вам нужен.»
лучше показать:
Brightbot — официальный crawler Bright Data для автоматизированного сбора публичных веб-данных. Настоящий Brightbot определяется одновременно по User-Agent Brightbot 1.0 и подсети 82.97.199.0/24. Bright Data также предоставляет Webmaster Console и collectors.txt для управления сбором. Если вы не хотите предоставлять данные этому crawler, его можно заблокировать отдельно, не затрагивая Googlebot и другие поисковые системы.
Итог
Brightbot — хорошо документированный data-collection crawler Bright Data. В отличие от множества малоизвестных ботов его можно достаточно надёжно идентифицировать: Bright Data официально публикует и User-Agent Brightbot 1.0, и исходную сеть 82.97.199.0/24, рекомендуя использовать оба признака одновременно.
Bright Data также заявляет встроенный cache примерно на 24 часа, систему автоматического мониторинга влияния трафика на сайты, Webmaster Console и собственный механизм collectors.txt для управления data collection.
Поэтому для TrafficVeil я бы классифицировал его как:
Data Collection Crawlers
→ Commercial Web Data Collection
→ Bright Data
→ Brightbot
Identity: Verified by UA + IP
Default: Monitor
И главное — не смешивать легитимность и желательность. Brightbot может быть полностью настоящим и технически подтверждённым crawler, но владелец сайта всё равно вправе не хотеть автоматизированного сбора своих публичных данных. В таком случае TrafficVeil должен дать понятный выбор между Allow, Monitor, collectors.txt, Rate Limit и Block.
Частые вопросы
Что такое Brightbot?
Как проверить настоящий Brightbot?
Как часто Brightbot повторно скачивает одну страницу?
Что такое collectors.txt?
Соблюдает ли Brightbot robots.txt?
Чем Brightbot отличается от BrightEdge Crawler?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.