В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а Cloudflare-AutoRAG с User-Agent cloudflare-autorag. Cloudflare-AutoRAG — краулер функции AI Search (прежнее название — AutoRAG) в экосистеме Cloudflare. Он индексирует контент сайта в векторную базу для retrieval-augmented generation (RAG) — то есть чтобы клиентское AI-приложение могло искать и использовать содержимое сайта как источник данных для ответов. Оператор: Cloudflare. Ключевая особенность: по официальной документации, этот краулер обходит только сайт, который сам владелец аккаунта Cloudflare выбрал как источник данных для AI Search — то есть, если бот появился в логах, почти наверняка кто-то в вашей организации сам включил эту интеграцию, а не сайт стал целью постороннего обхода.
Что такое Cloudflare-AutoRAG
| Параметр | Значение |
|---|---|
| Название | Cloudflare-AutoRAG (актуальное официальное название продукта — AI Search, UA может отображаться как Cloudflare-AI-Search) |
| User-Agent / паттерн | cloudflare-autorag / Cloudflare-AI-Search |
| Оператор | Cloudflare |
| Роль | Индексирует контент сайта в векторную базу RAG для клиентского AI-приложения, настроенного в том же аккаунте Cloudflare |
| Документация / ориентир | developers.cloudflare.com — раздел AI Search и справка по краулерам Cloudflare |
| Список IP | ❌ Отдельного публичного списка IP нет; управление доступом — через bot detection ID в WAF-правилах или отключение сайта как источника данных |
| robots.txt | Официального заявления о безусловном игнорировании нет; для управляемого блокирования Cloudflare рекомендует WAF-правила по detection ID, а не только robots.txt |
| Пометка TrafficVeil | Нежелательный по нагрузке / по сути — самостоятельно настроенная владельцем интеграция, а не сторонний обход |
Зачем Cloudflare-AutoRAG приходит на сайт
Это принципиально не тот сценарий, что у большинства ботов в категории «Прочие краулеры и сервисы». Обход запускается не произвольно и не по инициативе стороннего оператора, а потому что кто-то в вашей организации явно выбрал этот домен как источник данных в настройках AI Search на Cloudflare — домен при этом обязан находиться в том же аккаунте Cloudflare, что и сама функция AI Search.
- Какие зоны чаще трогает: контентные страницы сайта, выбранного как источник данных — весь публичный контент, который нужен для построения векторного индекса
- Что ищет: текстовое содержимое страниц для индексации в RAG-базу
- Чем отличается от браузерного пользователя: нет сессии, регулярные повторные обходы для обновления индекса
Типичный кейс: CDN-трафик и origin CPU растут без видимого источника в аналитике. Фильтр по cloudflare-autorag в логах показывает регулярный обход контентных разделов — и первый шаг здесь не блокировка, а проверка в дашборде Cloudflare, кто из команды подключил сайт к AI Search и зачем.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у cloudflare-autorag может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий — что логично, поскольку задача бота не привести посетителя, а обновить индекс. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на контентных страницах, а не служебных разделах.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти Cloudflare-AutoRAG в логах
# Базовый поиск
grep -i "cloudflare-autorag" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "cloudflare-autorag" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Официального списка IP для этого краулера нет, а строку UA теоретически может подделать любой скрипт. Но здесь есть более надёжный первый шаг верификации, чем IP/ASN: проверьте в дашборде Cloudflare вашего аккаунта, настроена ли интеграция AI Search и указан ли этот домен как источник данных. Если да — трафик легитимен по определению, поскольку технически краулер работает только в рамках того же аккаунта.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для Cloudflare-AutoRAG
# Жёсткий запрет
User-agent: cloudflare-autorag
Disallow: /
# Разрешить всё
User-agent: cloudflare-autorag
Allow: /
# Компромисс: закрыть служебные разделы, оставить контент
User-agent: cloudflare-autorag
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: если задача — не разрешать этому же сайту индексировать себя в вашей собственной RAG-системе, логичнее и надёжнее отключить домен как источник данных прямо в настройках AI Search на Cloudflare, а не только полагаться на robots.txt. Cloudflare также позволяет управлять доступом через WAF-правила по bot detection ID — это более точный инструмент, чем UA-based блокировка.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "cloudflare-autorag") {
return 403;
}
limit_req_zone $binary_remote_addr zone=cloudflareautorag:10m rate=10r/m;
location / {
if ($http_user_agent ~* "cloudflare-autorag") {
limit_req zone=cloudflareautorag burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cloudflare-autorag [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите cloudflare-autorag / Cloudflare-AutoRAG в ботах домена или в /system/bots
- Прежде чем блокировать — уточните у команды, не настроена ли интеграция AI Search осознанно
- Если интеграция не нужна — проще отключить её в дашборде Cloudflare, а серверную блокировку использовать как дополнительный слой
- После изменения сверьте логи: хиты cloudflare-autorag должны уйти в блок/лимит, а поисковики Google/Yandex остаться без изменений
Рекомендации: что делать с Cloudflare-AutoRAG
- Интеграция AI Search настроена осознанно и нужна — Allow, это часть вашей же инфраструктуры
- Никто в команде не подтверждает настройку — сначала проверьте дашборд Cloudflare, затем при необходимости отключите источник данных и/или заблокируйте на уровне сервера
- Нагрузка ощутимая, но интеграция нужна — используйте rate-limit вместо полного запрета
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с cloudflare-autorag
С кем не путать Cloudflare-AutoRAG
| Бот | Оператор | Отличие от Cloudflare-AutoRAG |
|---|---|---|
| CloudFlare-AlwaysOnline | Cloudflare | Кеширует копию сайта на случай недоступности origin — не связан с AI/RAG |
| Cloudflare-Healthchecks | Cloudflare | Проверяет доступность сайта по настроенным health checks, а не индексирует контент |
| CloudflareBrowserRenderingCrawler | Cloudflare | Обходит произвольные сторонние сайты по запросу разработчиков через Browser Run — в отличие от AutoRAG, не ограничен доменами того же аккаунта |
Частые вопросы
Что такое Collapsify и кто его оператор?
Зачем Collapsify приходит на сайт?
Активно ли развивается Collapsify сейчас?
Нужно ли блокировать Collapsify по умолчанию?
Публикует ли Cloudflare список IP для верификации Collapsify?
Чем Collapsify отличается от CloudFlare-AlwaysOnline?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.