TrafficVeil
Боты 7 мин13 августа 2026 г.

Browserbase в логах: чей-то AI-агент, а не один бот

Разбираем Browserbase — облачную инфраструктуру headless-браузеров для AI-агентов и автоматизации, которой пользуются тысячи разных компаний. Объясняем, почему часть трафика этой платформы намеренно не видна в логах, и как найти бота, настроить allow/deny.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Browserbase
  2. 2. Зачем Browserbase приходит на сайт
  3. 3. Нагрузка и риски именно для Browserbase
  4. 4. Как найти Browserbase в логах
  5. 5. robots.txt для Browserbase
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с Browserbase
  8. 8. С кем не путать Browserbase
  9. 9. Стратегия allow/deny для Browserbase
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а Browserbase с User-Agent browserbase. Это реальная и хорошо финансируемая компания (Сан-Франциско, основана в 2024 году, $68 млн инвестиций, оценка около $300 млн) — но важно понимать её природу: Browserbase не запускает собственного бота с одной задачей, а предоставляет облачную инфраструктуру headless-браузеров, которую используют для автоматизации веба больше тысячи разных компаний-клиентов, включая Perplexity, Vercel, Microsoft и другие.

1. Что такое Browserbase

Browserbase — это «браузер как услуга»: клиенты запускают автоматизированные headless-браузеры в облаке Browserbase вместо того, чтобы держать собственную инфраструктуру Playwright/Puppeteer/Selenium. Через эту инфраструктуру проходит более 50 миллионов браузерных сессий совокупно, и назначение каждой конкретной сессии определяет не Browserbase, а тот клиент, который её запустил — это может быть AI-агент, сбор данных, автоматическое тестирование, заполнение форм или любой другой сценарий автоматизации. Отдельная важная деталь: платформа сама предлагает клиентам режим stealth — маскировку под обычный браузер, обход обнаружения ботов, ротацию прокси и решение CAPTCHA. То есть значительная часть трафика через Browserbase спроектирована так, чтобы вообще не выглядеть автоматизированной — и то, что вы видите в логах именно plain-токен browserbase, а не замаскированный browser fingerprint, говорит о том, что для этой конкретной сессии клиент stealth-режим не использовал.

Название Browserbase
User-Agent / паттерн browserbase
Оператор Browserbase, Inc. — облачная инфраструктура headless-браузеров для разработчиков и AI-агентов; но сама компания не определяет цель конкретного визита — это делает клиент, использующий её инфраструктуру
Роль Технический слой для тысяч разных клиентских сценариев: AI-агенты, скрапинг данных, автоматизация workflow, тестирование — конкретная цель по одному UA не определяется
Документация / ориентир browserbase.com — публичный сайт компании, но first-party страницы специально для вебмастеров о том, как трактовать этот трафик, не найдено
Список IP ❌ Официального публичного списка IP не найдено — учитывая облачную и мультитенантную природу платформы (аналогично AWS/GCP), стабильного диапазона может не быть в принципе
robots.txt Зависит от того, что настроил конкретный клиент Browserbase в своём скрипте — сама платформа не гарантирует единую политику соблюдения для всех тысяч клиентов
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

2. Зачем Browserbase приходит на сайт

Появление browserbase в access.log означает, что чей-то автоматизированный сценарий — не обязательно ваш собственный — запустил headless-браузер через эту облачную платформу и обратился к вашему сайту. Причин может быть множество: AI-агент выполняет задачу пользователя (например, ищет информацию или заполняет форму по запросу), компания собирает данные для анализа, кто-то тестирует автоматизацией собственный или чужой сайт. Поскольку клиентов у Browserbase больше тысячи и они работают в совершенно разных сферах, определить точную причину по одному UA невозможно — нужно смотреть на конкретное поведение: какие страницы запрашиваются, есть ли попытки заполнения форм, повторяемость визитов.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику — зависит целиком от сценария конкретного клиента;
  • Что ищет: контент, формы, интерактивные элементы — соответствует задаче, которую поставил клиент Browserbase, а не единой логике одного оператора;
  • Чем отличается от браузерного пользователя: технически это настоящий браузерный движок (Playwright/Puppeteer совместимый), а не упрощённый HTTP-клиент — то есть в отличие от многих ботов такой трафик может выглядеть очень похоже на реального пользователя, включая рендеринг JS.

Типичный кейс: CDN-трафик дорожает, origin CPU нагружен рендерингом полноценных JS-страниц. Фильтр по browserbase показывает обращения на публичные URL — учитывая, что это полноценный браузерный движок, а не лёгкий HTTP-краулер, нагрузка на страницу от одной сессии может быть выше, чем от типового бота этой категории.

3. Нагрузка и риски именно для Browserbase

Отдельной строки в публичной сводке top-bot TrafficVeil у browserbase может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Для Browserbase этот риск усилен тем, что каждая сессия — это полноценный рендеринг браузера (JS, CSS, изображения), а не облегчённый запрос HTML, поэтому по нагрузке на сервер один визит Browserbase ближе к реальному пользователю, чем к лёгкому боту.

4. Как найти Browserbase в логах

Не ищите «просто ботов» — ищите конкретный токен browserbase, но помните, что часть трафика этой платформы через stealth-режим специально не будет содержать этого токена вовсе.

# Базовый поиск
grep -i "browserbase" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "browserbase" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — ожидайте разнообразие, это облачная мультитенантная инфраструктура
grep -i "browserbase" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "browserbase" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить, есть ли попытки заполнения форм — признак активного AI-агента, а не просто чтения контента
grep -i "browserbase" /var/log/nginx/access.log | grep -c "POST"

Верификация. Подделать User-Agent может любой скрипт. Для Browserbase верификация особенно сложна: платформа облачная и мультитенантная, официального списка IP нет, а часть легитимного трафика клиентов платформы намеренно замаскирована через stealth-режим и вообще не будет содержать этого токена. Опирайтесь на поведение (полноценный JS-рендеринг, попытки взаимодействия со страницей) больше, чем на один UA.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Browserbase

# Жёсткий запрет
User-agent: browserbase
Disallow: /

# Разрешить всё
User-agent: browserbase
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: browserbase
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для browserbase, если пользы нет. Учитывая, что робаты.txt-политику определяет не единая платформа, а код каждого конкретного клиента Browserbase, соблюдение правила совершенно не гарантировано — для надёжного результата переходите к правилам на уровне nginx/Apache или к запрету в TrafficVeil.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "browserbase") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=browserbase:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "browserbase") {
        limit_req zone=browserbase burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} browserbase [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите browserbase в ботах домена или в /system/bots;
  • Учитывайте, что это может быть трафик вашего собственного AI-агента/автоматизации (если вы клиент Browserbase) или трафик стороннего клиента платформы — эти два сценария требуют разной политики;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit;
  • После изменения сверьте логи и учитывайте, что часть трафика Browserbase может использовать stealth-режим и не отражаться в этой блокировке вовсе.

7. Рекомендации: что делать с Browserbase

  • Если сайт сам не использует Browserbase и пользы от чужого трафика не видно — Disallow/403;
  • Если это ваш собственный AI-агент или автоматизация через Browserbase — Allow только для нужных сценариев;
  • Если нагрузка мешает — учитывайте, что это полноценный браузерный рендеринг, а не лёгкий бот, поэтому rate-limit может быть особенно уместен;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете; но помните, что часть автоматизации через Browserbase (в stealth-режиме) блокировка по этому токену всё равно не остановит.

8. С кем не путать Browserbase

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный, не связан с Browserbase
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный (обобщённый токен, не путать с конкретной инфраструктурой)
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный, другой оператор

9. Стратегия allow/deny для Browserbase

Ситуация Действие
Это ваш собственный AI-агент/автоматизация через Browserbase Allow точечно + закрыть /admin /cart /api
Чужой клиент платформы, польза не видна Disallow + запрет в TrafficVeil на уровне сервера
Нужен доступ, но нагрузка от полноценного рендеринга мешает Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA или stealth-трафик того же облака Не доверять только UA; смотреть поведение — полноценный JS-рендеринг и попытки взаимодействия со страницей

Частые вопросы

Browserbase — это один конкретный бот с известной целью?

Нет, это облачная платформа, которой пользуются больше тысячи разных клиентов — AI-агенты, скрапинг, тестирование, автоматизация — и цель конкретного визита определяет клиент, а не сама компания.

Почему часть автоматизации через Browserbase не видна в логах вообще?

Платформа официально предлагает stealth-режим — маскировку под обычный браузер и обход детекции ботов, поэтому такой трафик просто не будет содержать токен browserbase.

Чем визит Browserbase отличается от обычного лёгкого бота?

Это полноценный браузерный движок с рендерингом JavaScript, CSS и изображений — по нагрузке на сервер такая сессия ближе к реальному пользователю, чем к лёгкому HTTP-краулеру.

Публикует ли Browserbase список IP-адресов?

Нет, официального списка не найдено — платформа облачная и мультитенантная, стабильного диапазона может не быть в принципе, как и у большинства облачных провайдеров.

Сработает ли Disallow в robots.txt против всех клиентов Browserbase?

Не гарантированно — политику соблюдения определяет код каждого конкретного клиента платформы, а не единая позиция самой компании.

Что теряет сайт при блокировке browserbase?

Зависит от того, чей это трафик — если это ваш собственный AI-агент или автоматизация, вы теряете её функциональность; если чужой клиент платформы, обычно ничего критичного.

#Browserbase#AI-агенты#headless-браузеры#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.