DigitalOceanGenAI Crawler (актуальное официальное название — DigitalOceanGradientAICrawler) — не безымянный сборщик сырья для чужого ИИ, а инструмент конкретного, хорошо известного облачного провайдера DigitalOcean. Краулер запускается только тогда, когда клиент DigitalOcean сам указывает сайт как источник данных для своей базы знаний в Gradient AI Platform (ранее — GenAI Platform).
Что такое DigitalOceanGradientAICrawler
| Параметр | Значение |
|---|---|
| Название | DigitalOceanGradientAICrawler (в старых источниках и в токене логов — digitaloceangenai-crawler, до переименования продукта GenAI Platform → Gradient AI Platform) |
| User-Agent / паттерн | DigitalOceanGradientAICrawler/1.0 |
| Оператор | DigitalOcean — крупный, публично известный облачный хостинг-провайдер |
| Роль | Индексирует сайт, который клиент DigitalOcean сам указал как источник данных для базы знаний своего ИИ-агента (RAG) на платформе Gradient AI |
| Документация / ориентир | docs.digitalocean.com/products/knowledge-bases/details/website-crawler/ |
| Лимиты обхода | До 5 500 страниц за одну задачу; пропускает недоступные или запрещённые ссылки; индексирует текст и часть форматов изображений; игнорирует видео и навигационные ссылки |
| robots.txt | Официально соблюдается — включая явные директивы Disallow и wildcard * |
| Список IP | ❌ Отдельного компактного официального списка не найдено; проверяйте ASN/поведение |
| Пометка TrafficVeil | Условно нежелательный по нагрузке / по сути — краулинг, инициированный владельцем аккаунта DigitalOcean, а не самостоятельный сбор данных компанией |
Почему это не «обучающий» краулер в привычном смысле
Ключевое отличие от классических AI-training ботов вроде Bytespider или CCBot: DigitalOceanGradientAICrawler не обходит открытый веб самостоятельно в поисках контента для обучения фундаментальных моделей. Он работает исключительно по явному указанию: клиент DigitalOcean, строящий собственного ИИ-агента или чат-бота, сам добавляет конкретный сайт как «seed URL» источника данных в свою базу знаний. Только после этого запускается индексация именно этого сайта. Это та же логика, что уже разбиралась для Google-CloudVertexBot и Cloudflare-AutoRAG: если вы видите этот бот в логах, весьма вероятно, что кто-то — ваша же команда, если вы клиент DigitalOcean, либо кто-то из ваших деловых партнёров/клиентов, строящих ИИ-агента на основе контента вашего сайта, — сам настроил эту интеграцию, а не DigitalOcean решила «взять» ваш контент по собственной инициативе.
Зачем DigitalOceanGradientAICrawler приходит на сайт
- Какие зоны трогает: страницы, явно добавленные клиентом как seed URL или через sitemap для конкретной базы знаний — не весь сайт бесконтрольно
- Что ищет: текстовый контент и определённые форматы изображений для построения базы знаний RAG-агента
- Чем отличается от массового AI-краулера: обход ограничен явно заданным списком страниц и жёстким лимитом в 5 500 страниц за задачу, а не открытым обходом всего сайта без границ
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у digitaloceangenai-crawler может не быть, но при внезапном появлении заметного трафика стоит в первую очередь уточнить у своей команды, не настроена ли интеграция с Gradient AI Platform осознанно — а не сразу считать это признаком стороннего сбора данных без вашего ведома. Смотрите не только абсолютный RPS, но и качество хитов: если обход ограничен конкретным, разумным набором URL и укладывается в официальный лимит 5 500 страниц — это ожидаемое поведение сконфигурированной интеграции, а не аномалия.
Как найти DigitalOceanGradientAICrawler в логах
# Базовый поиск (оба варианта названия — старое и новое)
grep -iE "digitaloceangenai-crawler|digitaloceangradientaicrawler" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -iE "digitaloceangenai-crawler|digitaloceangradientaicrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -iE "digitaloceangenai-crawler|digitaloceangradientaicrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Верификация
Подделать User-Agent может любой скрипт, а официального компактного списка IP DigitalOcean для этого конкретного краулера не публикует. Прежде чем реагировать на трафик как на угрозу, самый надёжный первый шаг — не техническая проверка, а внутренний вопрос команде: не настраивал ли кто-то из коллег или клиентов интеграцию с Gradient AI Platform для этого сайта.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для DigitalOceanGradientAICrawler
# Жёсткий запрет
User-agent: digitaloceangenai-crawler
Disallow: /
User-agent: DigitalOceanGradientAICrawler
Disallow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: DigitalOceanGradientAICrawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: соблюдение robots.txt здесь официально подтверждено самим DigitalOcean, включая wildcard-правила — это один из немногих AI-связанных краулеров, где Disallow действительно работает как заявлено, а не требует дублирования на сервере «на всякий случай».
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "digitaloceangenai-crawler|digitaloceangradientaicrawler") {
return 403;
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} digitaloceangenai-crawler [NC,OR]
RewriteCond %{HTTP_USER_AGENT} digitaloceangradientaicrawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите digitaloceangenai-crawler / DigitalOceanGradientAICrawler в ботах домена или в /system/bots
- Перед блокировкой уточните у команды, не настроена ли осознанная интеграция с Gradient AI Platform
- Если интеграция не нужна — Disallow достаточно надёжен благодаря официально подтверждённому соблюдению robots.txt
Рекомендации: что делать с DigitalOceanGradientAICrawler
- Вы сами или ваш клиент строит ИИ-агента на базе контента этого сайта через Gradient AI Platform — Allow, интеграция настроена осознанно
- Никто не подтверждает использование Gradient AI Platform — Disallow, здесь эта директива реально сработает благодаря официально задокументированному соблюдению robots.txt
- Не считайте этот бот автоматически «сырьевым» AI-краулером без атрибуции — это принципиально другая модель, чем у Bytespider или CCBot, обходящих открытый веб самостоятельно
- На классический Google/Yandex SEO блокировка не влияет
Частые вопросы
Кто на самом деле оператор DigitalOceanGenAI Crawler?
Обходит ли этот краулер открытый веб самостоятельно, как Bytespider или CCBot?
Как называется этот краулер сейчас, после переименования продукта?
Соблюдает ли этот бот правила robots.txt?
Сколько страниц может проиндексировать краулер за одну задачу?
Что делать, если этот бот неожиданно появился в логах сайта?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.