bigsur.ai — User-Agent веб-краулера компании Big Sur AI, используемого в AI-сценариях платформы.
Это не неизвестный сервис и не обычный технический клиент. Cloudflare Radar классифицирует Big Sur AI как Verified bot, указывает оператором Big Sur AI, категорию Training и модель доступа Direct.
Наблюдаемый User-Agent:
bigsur.ai (+https://www.bigsur.ai)
Поэтому для TrafficVeil правильная категория — не «Прочие краулеры и сервисы», а:
AI & LLM Crawlers
→ Training / AI Content Collection
→ Big Sur AI
| Параметр | Значение |
|---|---|
| Название | Big Sur AI |
| UA token | bigsur.ai |
| Полный наблюдаемый UA | bigsur.ai (+https://www.bigsur.ai) |
| Оператор | Big Sur AI |
| Категория | AI & LLM Crawlers / Training |
| Access model | Direct |
| Cloudflare status | Verified |
| Поисковый робот | Нет |
| TrafficVeil default | Monitor |
Что делает Big Sur AI crawler
Cloudflare описывает Big Sur AI Crawler как автоматический клиент, который получает сайты пользователей Big Sur AI для работы AI-функций платформы. В Bot Directory он относится к категории Training.
Это важное отличие от исходного описания.
Нельзя характеризовать его только как:
интеграционный сервис
проверка аккаунта
обычный служебный fetcher
Публичные bot directories однозначно относят bigsur.ai к AI-crawler. Tencent EdgeOne также включает его в список AI crawlers, которые система умеет отдельно обнаруживать и контролировать.
Почему Big Sur AI не стоит помещать в «Прочие сервисы»
Категория должна отражать назначение автоматизации.
Например:
FreshRSS → RSS & Feed Fetchers
LinkedInBot → Social / Link Preview
AdsBot-Google-Mobile → Ads Verification
SMTBot → Technology Intelligence
bigsur.ai → AI / Training
Так пользователь сразу понимает, почему конкретный клиент обращается к сайту и какие последствия может иметь его блокировка.
Как выглядит User-Agent bigsur.ai
Cloudflare Radar публикует:
bigsur.ai (+https://www.bigsur.ai)
Поэтому основной устойчивый идентификатор:
bigsur.ai
При поиске в access.log лучше использовать точную строку с экранированной точкой, если применяется регулярное выражение.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти bigsur.ai в access.log
Базовый поиск:
grep -i "bigsur\.ai" /var/log/nginx/access.log
Количество запросов:
grep -ic "bigsur\.ai" /var/log/nginx/access.log
Топ URL:
grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Почему точку лучше экранировать
В регулярных выражениях символ:
.
означает «любой символ».
Поэтому:
bigsur.ai
как regex может совпасть не только с буквальной строкой bigsur.ai.
Более точный вариант:
bigsur\.ai
Это мелкая, но полезная поправка для правил TrafficVeil, Nginx и анализа логов.
Какие URL получает Big Sur AI
Фиксированный публичный список директорий оператор не публикует.
Поэтому не стоит утверждать, что normal profile обязательно выглядит так:
/blog/
/product/
/category/
/api/
Лучше анализировать собственную телеметрию TrafficVeil.
Полезно определить:
- Top URLs;
- Unique URLs;
- глубину обхода;
- повторяемость;
- HTTP methods;
- частоту запросов;
- объём переданного контента.
Как проверить глубину обхода
grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort -u \
| wc -l
Это позволяет отличить несколько fetch от систематического обхода большого числа страниц.
Как проверить HTTP-методы
grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk -F'"' '{print $2}' \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn
Для обычного crawler наиболее ожидаемы GET/HEAD. Необычные методы нужно анализировать отдельно.
Big Sur AI — Verified bot, но UA всё равно можно подделать
Это важное различие.
Статус Verified у Cloudflare означает, что Cloudflare способен подтверждать этого бота в своей инфраструктуре.
Но строку:
User-Agent: bigsur.ai (+https://www.bigsur.ai)
может отправить любой HTTP-клиент.
Поэтому собственный антибот не должен строить правило:
UA contains bigsur.ai
→ unconditional trusted allow
Как верифицировать bigsur.ai в TrafficVeil
При отсутствии опубликованного компактного IP feed лучше использовать многофакторную модель:
- User-Agent;
- IP;
- ASN;
- ASN organization;
- network type;
- TLS fingerprint;
- HTTP fingerprint;
- частоту запросов;
- профиль URL;
- историю предыдущих наблюдений.
Так TrafficVeil сможет различать:
Claimed Big Sur AI
Verified/Probable Big Sur AI
Spoofed Big Sur AI
Observed IP не означает официальный IP Big Sur AI
Если TrafficVeil увидел UA bigsur.ai с конкретного адреса, это прежде всего:
Observed IP
а не автоматически:
Official Big Sur AI IP
| Identity status | Значение |
|---|---|
| Observed | С IP наблюдался bigsur.ai UA |
| Probable | Инфраструктура и поведение стабильно совпадают |
| Verified | Источник подтверждён доступным механизмом |
| Spoofed | UA противоречит инфраструктуре или поведению |
Как выглядит подозрительный bigsur.ai
Например:
User-Agent: bigsur.ai (+https://www.bigsur.ai)
GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.sql
GET /phpmyadmin/
GET /vendor/phpunit/
Такой профиль нельзя автоматически считать безопасным AI crawler только из-за имени.
TrafficVeil должен классифицировать источник по фактическому поведению.
Какой behavioural fingerprint использовать
| Признак | Обычный content crawler | Подозрительная автоматизация |
|---|---|---|
| URL | Публичные страницы | Конфиги и exploit paths |
| Методы | GET / HEAD | Необъяснимый перебор методов |
| Навигация | Content-oriented | Dictionary scanning |
| Fingerprint | Стабильный | Постоянно меняется |
| Network | Повторяемая инфраструктура | Residential/proxy rotation |
robots.txt для bigsur.ai
Для объявления полного запрета используется отдельный токен:
User-agent: bigsur.ai
Disallow: /
Именно такой пример показывает Cloudflare Bot Directory.
Токен bigsur.ai также присутствует в крупных community AI robots lists.
Частичное ограничение
User-agent: bigsur.ai
Disallow: /account/
Disallow: /checkout/
Disallow: /admin/
Disallow: /internal/
Disallow: /api/private/
Allow: /
Но robots.txt нельзя считать механизмом защиты приватных данных.
Соблюдает ли bigsur.ai robots.txt
На найденной карточке Cloudflare есть robots.txt-токен и пример блокировки, но отдельного достаточно сильного первичного источника, обещающего безусловное соблюдение robots.txt во всех сценариях, я бы не стал подменять предположением.
Поэтому для TrafficVeil безопаснее:
robots.txt token: confirmed
robots.txt compliance: monitor / verify behavior
Блокировка через Nginx
Для буквального совпадения точки желательно экранировать:
if ($http_user_agent ~* "bigsur\.ai") {
return 403;
}
Это жёсткое правило по UA и не выполняет identity verification.
Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} bigsur\.ai [NC]
RewriteRule ^ - [F,L]
Стоит ли блокировать Big Sur AI
Здесь нет универсального ответа.
В отличие от Googlebot, Big Sur AI crawler не нужен для классического поискового индексирования.
Поэтому решение зависит от политики владельца сайта относительно AI-crawling.
| Цель владельца | Рекомендация |
|---|---|
| Не против AI crawling | Allow / Monitor |
| Хотите видеть трафик, но контролировать нагрузку | Monitor |
| Не хотите предоставлять контент этому AI crawler | Disallow / Block |
| Высокая нагрузка | Verify → Rate Limit |
| UA используется для scanning | Block как spoofing |
Почему Default = Monitor разумнее автоматического Allow
Big Sur AI является легитимным оператором, а Cloudflare подтверждает crawler как Verified.
Но «легитимный» не означает «обязательный».
Например:
Googlebot
→ SEO/индексация
Big Sur AI
→ AI crawling
Для владельца сайта бизнес-ценность этих двух автоматизаций может быть совершенно разной.
Поэтому TrafficVeil лучше не смешивать:
Identity trust
и
Access recommendation
Правильнее:
Identity: Verified/Legitimate
Recommended action: Monitor
Owner choice: Allow / Block
Нужен ли Rate Limit
Если crawler разрешён, но создаёт заметную нагрузку, Rate Limit может быть компромиссом.
Однако сначала нужно оценить:
- Requests;
- Unique URLs;
- RPS/RPM;
- Bandwidth;
- Average Response Size;
- Cache HIT Ratio;
- Origin Requests;
- TTFB;
- число IP/ASN.
Количество hits не равно реальной нагрузке
Например:
20 000 requests
98% cache HIT
400 origin requests
могут быть дешевле:
1000 requests
0% cache HIT
1000 тяжёлых dynamic renders
Поэтому для AI crawler TrafficVeil стоит показывать не только количество запросов, но и Origin Impact.
Что будет после блокировки bigsur.ai
Точечная блокировка остановит доступ клиентов, идентифицированных как Big Sur AI.
Она не является блокировкой Googlebot, YandexBot или Bingbot.
То есть прямого механического влияния на обычную индексацию Google/Yandex у такого правила нет.
Не стоит обещать конкретную потерю AI-цитирований
В исходном шаблоне для AI crawler часто используется формулировка:
«После блокировки вы потеряете цитирования в AI-ответах».
Для Big Sur AI это слишком конкретное утверждение без соответствующей публичной документации.
Корректнее:
Блокировка ограничит возможность Big Sur AI получать страницы сайта для своих AI-сценариев.
Как учитывать bigsur.ai в аналитике
Запросы crawler нельзя считать обычными посещениями.
Для TrafficVeil:
Automated Traffic
→ AI & LLM Crawlers
→ Training
→ Big Sur AI
Рекомендуется:
- исключать из Human Traffic;
- не считать конверсией;
- не относить подтверждённый crawler к malicious bots;
- учитывать отдельно в AI Traffic;
- показывать Origin Impact;
- сохранять Identity Confidence.
Почему категорию «Прочие краулеры» лучше убрать
Для пользователя TrafficVeil вопрос:
«Что это за бот?»
важнее внутренней технической классификации.
Описание:
Прочий легитимный сервис
почти ничего не объясняет.
А:
AI & LLM Crawlers
→ Training
→ Big Sur AI
сразу показывает назначение автоматизации.
С кем не путать Big Sur AI
| Бот | Категория |
|---|---|
| bigsur.ai | AI / Training |
| GPTBot | AI crawler другого оператора |
| ClaudeBot | AI crawler другого оператора |
| Googlebot | Search crawler |
| LinkedInBot | Social / Link Preview |
| SMTBot | Technology Intelligence |
Не стоит создавать одно широкое правило «AI» без понимания последствий для каждого конкретного агента.
Рекомендуемая карточка TrafficVeil
| Поле | Значение |
|---|---|
| Name | Big Sur AI |
| Operator | Big Sur AI |
| Category | AI & LLM Crawlers |
| Subtype | Training / AI Content Collection |
| UA | bigsur.ai (+https://www.bigsur.ai) |
| Cloudflare verification | Verified |
| Access model | Direct |
| robots token | bigsur.ai |
| Default action | Monitor |
| Human analytics | Exclude |
| AI analytics | Include |
Стратегия Allow / Monitor / Rate Limit / Block
| Ситуация | Действие |
|---|---|
| Источник подтверждён, AI crawling разрешён | Allow |
| Источник подтверждён, решение ещё не принято | Monitor |
| AI crawling не нужен | Disallow / Block |
| Большая нагрузка, но доступ нужен | Rate Limit |
| UA совпал, identity сомнительна | Verify |
| Под UA идёт vulnerability scanning | Block / reclassify |
Что показывать пользователю TrafficVeil
Вместо:
«bigsur.ai — неизвестный легитимный сервис. Решение принимайте по бизнес-пользе.»
лучше:
Big Sur AI — подтверждённый AI-crawler с User-Agent bigsur.ai. Cloudflare относит его к категории Training. Если вы не хотите предоставлять контент этому AI-сервису, доступ можно ограничить отдельно, не затрагивая Googlebot и другие поисковые системы.
Итог
bigsur.ai — не неизвестный служебный бот, а отдельный AI-crawler компании Big Sur AI. Cloudflare Radar подтверждает его как Verified bot, указывает категорию Training, прямую модель управления и User-Agent bigsur.ai (+https://www.bigsur.ai).
Tencent EdgeOne также независимо классифицирует bigsur.ai как AI crawler, что дополнительно подтверждает корректность переноса его из «Прочих сервисов» в AI-категорию.
Для TrafficVeil оптимальная модель — Legitimate AI Crawler / Training / Default: Monitor.
То есть легитимность оператора и решение о доступе нужно разделять. Big Sur AI может быть настоящим и безопасным crawler, но владелец сайта всё равно вправе не хотеть, чтобы его контент использовался этим AI-сервисом. Поэтому TrafficVeil должен объяснить назначение агента и дать понятный выбор: Allow, Monitor, Rate Limit или Block.
Частые вопросы
Что такое bigsur.ai?
Кто является оператором bigsur.ai?
Для чего Big Sur AI получает сайты?
Как выглядит User-Agent?
Можно ли заблокировать bigsur.ai через robots.txt?
Какой статус установить в TrafficVeil?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.