В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а Cloudflare-AutoRAG с User-Agent cloudflare-autorag. Cloudflare-AutoRAG — краулер функции AI Search (прежнее название — AutoRAG) в экосистеме Cloudflare. Он индексирует контент сайта в векторную базу для retrieval-augmented generation (RAG) — то есть чтобы клиентское AI-приложение могло искать и использовать содержимое сайта как источник данных для ответов. Оператор: Cloudflare. Ключевая особенность: по официальной документации, этот краулер обходит только сайт, который сам владелец аккаунта Cloudflare выбрал как источник данных для AI Search — то есть, если бот появился в логах, почти наверняка кто-то в вашей организации сам включил эту интеграцию, а не сайт стал целью постороннего обхода.
Что такое Cloudflare-AutoRAG
| Параметр | Значение |
|---|---|
| Название | Cloudflare-AutoRAG (актуальное официальное название продукта — AI Search, UA может отображаться как Cloudflare-AI-Search) |
| User-Agent / паттерн | cloudflare-autorag / Cloudflare-AI-Search |
| Оператор | Cloudflare |
| Роль | Индексирует контент сайта в векторную базу RAG для клиентского AI-приложения, настроенного в том же аккаунте Cloudflare |
| Документация / ориентир | developers.cloudflare.com — раздел AI Search и справка по краулерам Cloudflare |
| Список IP | ❌ Отдельного публичного списка IP нет; управление доступом — через bot detection ID в WAF-правилах или отключение сайта как источника данных |
| robots.txt | Официального заявления о безусловном игнорировании нет; для управляемого блокирования Cloudflare рекомендует WAF-правила по detection ID, а не только robots.txt |
| Пометка TrafficVeil | Нежелательный по нагрузке / по сути — самостоятельно настроенная владельцем интеграция, а не сторонний обход |
Зачем Cloudflare-AutoRAG приходит на сайт
Это принципиально не тот сценарий, что у большинства ботов в категории «Прочие краулеры и сервисы». Обход запускается не произвольно и не по инициативе стороннего оператора, а потому что кто-то в вашей организации явно выбрал этот домен как источник данных в настройках AI Search на Cloudflare — домен при этом обязан находиться в том же аккаунте Cloudflare, что и сама функция AI Search.
- Какие зоны чаще трогает: контентные страницы сайта, выбранного как источник данных — весь публичный контент, который нужен для построения векторного индекса
- Что ищет: текстовое содержимое страниц для индексации в RAG-базу
- Чем отличается от браузерного пользователя: нет сессии, регулярные повторные обходы для обновления индекса
Типичный кейс: CDN-трафик и origin CPU растут без видимого источника в аналитике. Фильтр по cloudflare-autorag в логах показывает регулярный обход контентных разделов — и первый шаг здесь не блокировка, а проверка в дашборде Cloudflare, кто из команды подключил сайт к AI Search и зачем.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у cloudflare-autorag может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий — что логично, поскольку задача бота не привести посетителя, а обновить индекс. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на контентных страницах, а не служебных разделах.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти Cloudflare-AutoRAG в логах
# Базовый поиск
grep -i "cloudflare-autorag" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Официального списка IP для этого краулера нет, а строку UA теоретически может подделать любой скрипт. Но здесь есть более надёжный первый шаг верификации, чем IP/ASN: проверьте в дашборде Cloudflare вашего аккаунта, настроена ли интеграция AI Search и указан ли этот домен как источник данных. Если да — трафик легитимен по определению, поскольку технически краулер работает только в рамках того же аккаунта.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для Cloudflare-AutoRAG
# Жёсткий запрет
User-agent: cloudflare-autorag
Disallow: /
# Разрешить всё
User-agent: cloudflare-autorag
Allow: /
# Компромисс: закрыть служебные разделы, оставить контент
User-agent: cloudflare-autorag
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: если задача — не разрешать этому же сайту индексировать себя в вашей собственной RAG-системе, логичнее и надёжнее отключить домен как источник данных прямо в настройках AI Search на Cloudflare, а не только полагаться на robots.txt. Cloudflare также позволяет управлять доступом через WAF-правила по bot detection ID — это более точный инструмент, чем UA-based блокировка.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "cloudflare-autorag") {
return 403;
}
limit_req_zone $binary_remote_addr zone=cloudflareautorag:10m rate=10r/m;
location / {
if ($http_user_agent ~* "cloudflare-autorag") {
limit_req zone=cloudflareautorag burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cloudflare-autorag [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите cloudflare-autorag / Cloudflare-AutoRAG в ботах домена или в /system/bots
- Прежде чем блокировать — уточните у команды, не настроена ли интеграция AI Search осознанно
- Если интеграция не нужна — проще отключить её в дашборде Cloudflare, а серверную блокировку использовать как дополнительный слой
- После изменения сверьте логи: хиты cloudflare-autorag должны уйти в блок/лимит, а поисковики Google/Yandex остаться без изменений
Рекомендации: что делать с Cloudflare-AutoRAG
- Интеграция AI Search настроена осознанно и нужна — Allow, это часть вашей же инфраструктуры
- Никто в команде не подтверждает настройку — сначала проверьте дашборд Cloudflare, затем при необходимости отключите источник данных и/или заблокируйте на уровне сервера
- Нагрузка ощутимая, но интеграция нужна — используйте rate-limit вместо полного запрета
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с cloudflare-autorag
С кем не путать Cloudflare-AutoRAG
| Бот | Оператор | Отличие от Cloudflare-AutoRAG |
|---|---|---|
| CloudFlare-AlwaysOnline | Cloudflare | Кеширует копию сайта на случай недоступности origin — не связан с AI/RAG |
| Cloudflare-Healthchecks | Cloudflare | Проверяет доступность сайта по настроенным health checks, а не индексирует контент |
| CloudflareBrowserRenderingCrawler | Cloudflare | Обходит произвольные сторонние сайты по запросу разработчиков через Browser Run — в отличие от AutoRAG, не ограничен доменами того же аккаунта |
Частые вопросы
Что такое Cloudflare-AutoRAG и кто его оператор?
Может ли Cloudflare-AutoRAG обходить чужой сайт без ведома владельца?
Что делать, если Cloudflare-AutoRAG появился в логах, а команда не подтверждает настройку?
Соблюдает ли Cloudflare-AutoRAG правила robots.txt?
Как правильно отключить Cloudflare-AutoRAG, если интеграция не нужна?
Чем Cloudflare-AutoRAG отличается от CloudflareBrowserRenderingCrawler?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.