Важно: у Brave Search официально индекс-краулер не афиширует отдельный User-Agent как основной канал — по их собственному объяснению, чтобы сайты с allowlist только для Googlebot не резали его автоматически. Правило Brave: если страница не crawlable для Googlebot, Brave её тоже не краулит. Делистинг — через noindex, а не через robots.txt для «Bravebot». В логах при этом встречается токен Bravebot (часто со ссылкой на help Brave). Это отдельный видимый идентификатор — трактуйте его как заявленный fetch/AI-search-adjacent трафик Brave, но не как единственный и не как криптографически подтверждённый канал попадания в индекс Brave.
Параметры
| Параметр | Значение |
|---|---|
| Офиц. индекс | Без дифференцированного UA как официальной политики; docs: Brave Search Crawler (search.brave.com/help/brave-search-crawler) |
| UA в логах | Часто ... compatible; Bravebot/1.0; +https://search.brave.com/help/brave-search-crawler ... |
| Верификация | ❌ Официального метода криптографической проверки нет — совпадение строки UA само по себе не доказательство подлинности |
| Делистинг | noindex + повторный re-fetch со стороны Brave |
| robots для индекса | Не главный рычаг по официальной формулировке; важнее crawlability для Googlebot |
Официальная причина против реальной — и реакция сообщества
Публичная формулировка Brave звучит как забота о справедливости: краулер не афиширует UA, «чтобы избежать дискриминации со стороны сайтов, разрешающих обход только Google». Но в комментариях руководитель поискового направления Brave дал более прагматичное объяснение: у компании просто нет ресурсов связываться со всеми владельцами доменов, которые и так — обоснованно или нет — разрешают доступ исключительно Googlebot. Эта двойственность вызвала реальный публичный конфликт: сообщество разработчиков Lobste.rs заблокировало браузер Brave на своём сайте, обвинив компанию в том, что официальное заявление о соблюдении robots.txt не соответствует действительности для основного индексирующего краулера. Прямого консенсуса по этому вопросу в открытых источниках нет — часть сторонних трекеров (Trakkr, OpenShadow, algoblueprints) описывает Bravebot как краулер, честно соблюдающий Disallow-директивы, тогда как сообщество вебмастеров указывает на историческое несоответствие между заявлением и практикой именно для основного индекс-краулера.
Почему совпадение строки UA — не доказательство
Независимый каталог ботов прямо предупреждает: Bravebot не публикует официальный метод верификации (ни список IP, ни криптографическую подпись), поэтому любой клиент технически может присвоить себе эту строку UA. Совпадение в логах — подсказка, а не подтверждение подлинности. Это прямо усиливает и без того осторожную позицию: не считайте наличие токена «Bravebot» единственным или надёжным каналом контроля присутствия сайта в индексе Brave.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Индекс строится не только краулингом
У Brave Search есть менее очевидный источник данных для индекса — Web Discovery Project, opt-in система, в рамках которой пользователи браузера Brave анонимно делятся данными о посещённых страницах и поисковых запросах. Это означает, что присутствие сайта в результатах Brave Search частично может формироваться из поведения реальных пользователей браузера, независимо от того, что делает или не делает краулер Bravebot технически.
Нагрузка
По сводке TrafficVeil — порядка 1,4 тысячи запросов с токеном bravebot.
Контроль
grep -i "Bravebot" /var/log/nginx/access.log
User-agent: Bravebot
Disallow: /
# выход из индекса Brave: meta/X-Robots-Tag noindex (не только Disallow Bravebot)
Рекомендации
- Нужен Brave Search — не ломайте crawlability для Googlebot; Disallow: Bravebot сам по себе не заменяет политику индекса, поскольку официально решающий фактор — доступность страницы именно для Googlebot
- Не хотите видимый Bravebot-fetch — Disallow + deny по UA, но учитывайте, что это лишь один из возможных каналов, а не гарантированный полный контроль
- Хотите реально убрать страницу из индекса Brave — используйте noindex и дождитесь повторного re-fetch, а не полагайтесь только на robots.txt
- Не принимайте появление токена Bravebot в логах как стопроцентное доказательство подлинности — официального метода верификации нет
Частые вопросы
Почему Brave официально не публикует отдельный User-Agent для своего краулера?
Действительно ли Bravebot соблюдает robots.txt, как заявляет Brave?
Можно ли доверять токену Bravebot в логах как доказательству подлинности?
Как на самом деле убрать страницу из индекса Brave Search?
От чего зависит, будет ли Brave вообще краулить страницу?
Что такое Web Discovery Project и как он связан с индексом Brave?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.