Боты8 мин чтения·12 августа 2026 г.·обновлено 8 сентября 2026 г.

Bigsur.ai: что это за AI-краулер Big Sur AI и нужно ли его блокировать

bigsur.ai — подтверждённый AI-crawler компании Big Sur AI. Разбираемся, зачем он получает страницы сайтов, как выглядит User-Agent, как отличить настоящий Big Sur AI от spoofing и когда использовать Allow, Monitor, Rate Limit или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота bigsur.ai: легитимный прочие краулеры и сервисы

bigsur.ai — User-Agent веб-краулера компании Big Sur AI, используемого в AI-сценариях платформы.

Это не неизвестный сервис и не обычный технический клиент. Cloudflare Radar классифицирует Big Sur AI как Verified bot, указывает оператором Big Sur AI, категорию Training и модель доступа Direct.

Наблюдаемый User-Agent:

bigsur.ai (+https://www.bigsur.ai)

Поэтому для TrafficVeil правильная категория — не «Прочие краулеры и сервисы», а:

AI & LLM Crawlers
→ Training / AI Content Collection
→ Big Sur AI
Параметр Значение
Название Big Sur AI
UA token bigsur.ai
Полный наблюдаемый UA bigsur.ai (+https://www.bigsur.ai)
Оператор Big Sur AI
Категория AI & LLM Crawlers / Training
Access model Direct
Cloudflare status Verified
Поисковый робот Нет
TrafficVeil default Monitor

Что делает Big Sur AI crawler

Cloudflare описывает Big Sur AI Crawler как автоматический клиент, который получает сайты пользователей Big Sur AI для работы AI-функций платформы. В Bot Directory он относится к категории Training.

Это важное отличие от исходного описания.

Нельзя характеризовать его только как:

интеграционный сервис
проверка аккаунта
обычный служебный fetcher

Публичные bot directories однозначно относят bigsur.ai к AI-crawler. Tencent EdgeOne также включает его в список AI crawlers, которые система умеет отдельно обнаруживать и контролировать.

Почему Big Sur AI не стоит помещать в «Прочие сервисы»

Категория должна отражать назначение автоматизации.

Например:

FreshRSS → RSS & Feed Fetchers
LinkedInBot → Social / Link Preview
AdsBot-Google-Mobile → Ads Verification
SMTBot → Technology Intelligence
bigsur.ai → AI / Training

Так пользователь сразу понимает, почему конкретный клиент обращается к сайту и какие последствия может иметь его блокировка.

Как выглядит User-Agent bigsur.ai

Cloudflare Radar публикует:

bigsur.ai (+https://www.bigsur.ai)

Поэтому основной устойчивый идентификатор:

bigsur.ai

При поиске в access.log лучше использовать точную строку с экранированной точкой, если применяется регулярное выражение.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти bigsur.ai в access.log

Базовый поиск:

grep -i "bigsur\.ai" /var/log/nginx/access.log

Количество запросов:

grep -ic "bigsur\.ai" /var/log/nginx/access.log

Топ URL:

grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

Топ IP:

grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

HTTP-коды:

grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn

Почему точку лучше экранировать

В регулярных выражениях символ:

.

означает «любой символ».

Поэтому:

bigsur.ai

как regex может совпасть не только с буквальной строкой bigsur.ai.

Более точный вариант:

bigsur\.ai

Это мелкая, но полезная поправка для правил TrafficVeil, Nginx и анализа логов.

Какие URL получает Big Sur AI

Фиксированный публичный список директорий оператор не публикует.

Поэтому не стоит утверждать, что normal profile обязательно выглядит так:

/blog/
/product/
/category/
/api/

Лучше анализировать собственную телеметрию TrafficVeil.

Полезно определить:

  • Top URLs;
  • Unique URLs;
  • глубину обхода;
  • повторяемость;
  • HTTP methods;
  • частоту запросов;
  • объём переданного контента.

Как проверить глубину обхода

grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort -u \
| wc -l

Это позволяет отличить несколько fetch от систематического обхода большого числа страниц.

Как проверить HTTP-методы

grep -i "bigsur\.ai" /var/log/nginx/access.log \
| awk -F'"' '{print $2}' \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn

Для обычного crawler наиболее ожидаемы GET/HEAD. Необычные методы нужно анализировать отдельно.

Big Sur AI — Verified bot, но UA всё равно можно подделать

Это важное различие.

Статус Verified у Cloudflare означает, что Cloudflare способен подтверждать этого бота в своей инфраструктуре.

Но строку:

User-Agent: bigsur.ai (+https://www.bigsur.ai)

может отправить любой HTTP-клиент.

Поэтому собственный антибот не должен строить правило:

UA contains bigsur.ai
→ unconditional trusted allow

Как верифицировать bigsur.ai в TrafficVeil

При отсутствии опубликованного компактного IP feed лучше использовать многофакторную модель:

  • User-Agent;
  • IP;
  • ASN;
  • ASN organization;
  • network type;
  • TLS fingerprint;
  • HTTP fingerprint;
  • частоту запросов;
  • профиль URL;
  • историю предыдущих наблюдений.

Так TrafficVeil сможет различать:

Claimed Big Sur AI
Verified/Probable Big Sur AI
Spoofed Big Sur AI

Observed IP не означает официальный IP Big Sur AI

Если TrafficVeil увидел UA bigsur.ai с конкретного адреса, это прежде всего:

Observed IP

а не автоматически:

Official Big Sur AI IP
Identity status Значение
Observed С IP наблюдался bigsur.ai UA
Probable Инфраструктура и поведение стабильно совпадают
Verified Источник подтверждён доступным механизмом
Spoofed UA противоречит инфраструктуре или поведению

Как выглядит подозрительный bigsur.ai

Например:

User-Agent: bigsur.ai (+https://www.bigsur.ai)

GET /.env
GET /.git/config
GET /wp-login.php
GET /backup.sql
GET /phpmyadmin/
GET /vendor/phpunit/

Такой профиль нельзя автоматически считать безопасным AI crawler только из-за имени.

TrafficVeil должен классифицировать источник по фактическому поведению.

Какой behavioural fingerprint использовать

Признак Обычный content crawler Подозрительная автоматизация
URL Публичные страницы Конфиги и exploit paths
Методы GET / HEAD Необъяснимый перебор методов
Навигация Content-oriented Dictionary scanning
Fingerprint Стабильный Постоянно меняется
Network Повторяемая инфраструктура Residential/proxy rotation

robots.txt для bigsur.ai

Для объявления полного запрета используется отдельный токен:

User-agent: bigsur.ai
Disallow: /

Именно такой пример показывает Cloudflare Bot Directory.

Токен bigsur.ai также присутствует в крупных community AI robots lists.

Частичное ограничение

User-agent: bigsur.ai
Disallow: /account/
Disallow: /checkout/
Disallow: /admin/
Disallow: /internal/
Disallow: /api/private/
Allow: /

Но robots.txt нельзя считать механизмом защиты приватных данных.

Соблюдает ли bigsur.ai robots.txt

На найденной карточке Cloudflare есть robots.txt-токен и пример блокировки, но отдельного достаточно сильного первичного источника, обещающего безусловное соблюдение robots.txt во всех сценариях, я бы не стал подменять предположением.

Поэтому для TrafficVeil безопаснее:

robots.txt token: confirmed
robots.txt compliance: monitor / verify behavior

Блокировка через Nginx

Для буквального совпадения точки желательно экранировать:

if ($http_user_agent ~* "bigsur\.ai") {
    return 403;
}

Это жёсткое правило по UA и не выполняет identity verification.

Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} bigsur\.ai [NC]
RewriteRule ^ - [F,L]

Стоит ли блокировать Big Sur AI

Здесь нет универсального ответа.

В отличие от Googlebot, Big Sur AI crawler не нужен для классического поискового индексирования.

Поэтому решение зависит от политики владельца сайта относительно AI-crawling.

Цель владельца Рекомендация
Не против AI crawling Allow / Monitor
Хотите видеть трафик, но контролировать нагрузку Monitor
Не хотите предоставлять контент этому AI crawler Disallow / Block
Высокая нагрузка Verify → Rate Limit
UA используется для scanning Block как spoofing

Почему Default = Monitor разумнее автоматического Allow

Big Sur AI является легитимным оператором, а Cloudflare подтверждает crawler как Verified.

Но «легитимный» не означает «обязательный».

Например:

Googlebot
→ SEO/индексация

Big Sur AI
→ AI crawling

Для владельца сайта бизнес-ценность этих двух автоматизаций может быть совершенно разной.

Поэтому TrafficVeil лучше не смешивать:

Identity trust
и
Access recommendation

Правильнее:

Identity: Verified/Legitimate
Recommended action: Monitor
Owner choice: Allow / Block

Нужен ли Rate Limit

Если crawler разрешён, но создаёт заметную нагрузку, Rate Limit может быть компромиссом.

Однако сначала нужно оценить:

  • Requests;
  • Unique URLs;
  • RPS/RPM;
  • Bandwidth;
  • Average Response Size;
  • Cache HIT Ratio;
  • Origin Requests;
  • TTFB;
  • число IP/ASN.

Количество hits не равно реальной нагрузке

Например:

20 000 requests
98% cache HIT
400 origin requests

могут быть дешевле:

1000 requests
0% cache HIT
1000 тяжёлых dynamic renders

Поэтому для AI crawler TrafficVeil стоит показывать не только количество запросов, но и Origin Impact.

Что будет после блокировки bigsur.ai

Точечная блокировка остановит доступ клиентов, идентифицированных как Big Sur AI.

Она не является блокировкой Googlebot, YandexBot или Bingbot.

То есть прямого механического влияния на обычную индексацию Google/Yandex у такого правила нет.

Не стоит обещать конкретную потерю AI-цитирований

В исходном шаблоне для AI crawler часто используется формулировка:

«После блокировки вы потеряете цитирования в AI-ответах».

Для Big Sur AI это слишком конкретное утверждение без соответствующей публичной документации.

Корректнее:

Блокировка ограничит возможность Big Sur AI получать страницы сайта для своих AI-сценариев.

Как учитывать bigsur.ai в аналитике

Запросы crawler нельзя считать обычными посещениями.

Для TrafficVeil:

Automated Traffic
→ AI & LLM Crawlers
→ Training
→ Big Sur AI

Рекомендуется:

  • исключать из Human Traffic;
  • не считать конверсией;
  • не относить подтверждённый crawler к malicious bots;
  • учитывать отдельно в AI Traffic;
  • показывать Origin Impact;
  • сохранять Identity Confidence.

Почему категорию «Прочие краулеры» лучше убрать

Для пользователя TrafficVeil вопрос:

«Что это за бот?»

важнее внутренней технической классификации.

Описание:

Прочий легитимный сервис

почти ничего не объясняет.

А:

AI & LLM Crawlers
→ Training
→ Big Sur AI

сразу показывает назначение автоматизации.

С кем не путать Big Sur AI

Бот Категория
bigsur.ai AI / Training
GPTBot AI crawler другого оператора
ClaudeBot AI crawler другого оператора
Googlebot Search crawler
LinkedInBot Social / Link Preview
SMTBot Technology Intelligence

Не стоит создавать одно широкое правило «AI» без понимания последствий для каждого конкретного агента.

Рекомендуемая карточка TrafficVeil

Поле Значение
Name Big Sur AI
Operator Big Sur AI
Category AI & LLM Crawlers
Subtype Training / AI Content Collection
UA bigsur.ai (+https://www.bigsur.ai)
Cloudflare verification Verified
Access model Direct
robots token bigsur.ai
Default action Monitor
Human analytics Exclude
AI analytics Include

Стратегия Allow / Monitor / Rate Limit / Block

Ситуация Действие
Источник подтверждён, AI crawling разрешён Allow
Источник подтверждён, решение ещё не принято Monitor
AI crawling не нужен Disallow / Block
Большая нагрузка, но доступ нужен Rate Limit
UA совпал, identity сомнительна Verify
Под UA идёт vulnerability scanning Block / reclassify

Что показывать пользователю TrafficVeil

Вместо:

«bigsur.ai — неизвестный легитимный сервис. Решение принимайте по бизнес-пользе.»

лучше:

Big Sur AI — подтверждённый AI-crawler с User-Agent bigsur.ai. Cloudflare относит его к категории Training. Если вы не хотите предоставлять контент этому AI-сервису, доступ можно ограничить отдельно, не затрагивая Googlebot и другие поисковые системы.

Итог

bigsur.ai — не неизвестный служебный бот, а отдельный AI-crawler компании Big Sur AI. Cloudflare Radar подтверждает его как Verified bot, указывает категорию Training, прямую модель управления и User-Agent bigsur.ai (+https://www.bigsur.ai).

Tencent EdgeOne также независимо классифицирует bigsur.ai как AI crawler, что дополнительно подтверждает корректность переноса его из «Прочих сервисов» в AI-категорию.

Для TrafficVeil оптимальная модель — Legitimate AI Crawler / Training / Default: Monitor.

То есть легитимность оператора и решение о доступе нужно разделять. Big Sur AI может быть настоящим и безопасным crawler, но владелец сайта всё равно вправе не хотеть, чтобы его контент использовался этим AI-сервисом. Поэтому TrafficVeil должен объяснить назначение агента и дать понятный выбор: Allow, Monitor, Rate Limit или Block.

Частые вопросы

Что такое bigsur.ai?
Это User-Agent AI-crawler компании Big Sur AI. Cloudflare Radar помечает Big Sur AI как Verified bot, относит его к категории Training и указывает UA bigsur.ai (+https://www.bigsur.ai).
Кто является оператором bigsur.ai?
Оператор подтверждён — Big Sur AI. Это не случайный неизвестный UA и не self-hosted программа вроде FreshRSS.
Для чего Big Sur AI получает сайты?
Cloudflare описывает crawler как инструмент, который получает сайты пользователей Big Sur AI для работы AI-функций, и относит его к Training. Поэтому правильнее считать его AI-content crawler, а не обычным сервисным fetcher.
Как выглядит User-Agent?
Cloudflare фиксирует точную строку bigsur.ai (+https://www.bigsur.ai). Для первичного обнаружения достаточно токена bigsur.ai.
Можно ли заблокировать bigsur.ai через robots.txt?
Можно объявить отдельное правило User-agent: bigsur.ai / Disallow: /. Такой токен используется в каталогах и anti-AI robots lists. Но найденные источники не дают мне достаточных оснований обещать гарантированное соблюдение robots.txt во всех случаях, поэтому TrafficVeil лучше отдельно проверять фактическое поведение.
Какой статус установить в TrafficVeil?
Для подтверждённого источника я бы использовал Legitimate AI Crawler / Training, но не автоматический Allow. Базовое действие логичнее сделать Monitor, а решение Allow/Block оставить владельцу сайта: оно зависит от того, хочет ли он разрешать этот тип AI-crawling.
#bigsur.ai#Big Sur AI#Big Sur AI crawler#AI crawler#LLM crawler#training bot#User-Agent#robots.txt#TrafficVeil#bot detection
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil