Google-CloudVertexBot — краулер инфраструктуры Google для сценариев Vertex AI Agents: обходит сайт только тогда, когда владелец сайта или клиент Google Cloud сам настраивает agent workflow, которому нужны данные именно с этого домена. Официально: не влияет на Google Search и другие search-продукты.
Параметры
| Параметр | Значение |
|---|---|
| Токены robots | Google-CloudVertexBot, также учитывает правила для Googlebot |
| Подстрока UA | Google-CloudVertexBot |
| Docs | Google common crawlers; отдельно — документация Vertex AI Agent Builder / Agent Search |
| Верификация | Как у остальных краулеров Google: rDNS *.googlebot.com / google.com + forward DNS / официальные IP-диапазоны Google |
| Влияние на Search | ❌ Нет |
Почему бот в принципе не появляется «просто так»
Ключевое отличие этого краулера от классических поисковых ботов: он технически не может начать обход сайта по собственной инициативе. Google-CloudVertexBot запускается только тогда, когда кто-то — сам владелец сайта или клиент Google Cloud, настраивающий ИИ-агента, — явно указал этот домен как источник данных при построении Vertex AI Agent. Если вы видите этот UA в логах, это почти наверняка означает: либо ваша же команда собирает агента на основе контента сайта, либо это делает кто-то из ваших клиентов/партнёров, которому для работы агента нужны данные именно с вашего домена. Из этого следует практический вывод, который подтверждают независимые разборы запуска бота: добавлять его в robots.txt «на всякий случай», без понимания, кто и зачем его инициировал, обычно не требуется — сама природа owner-initiated краулинга уже исключает случайные или нежелательные визиты.
Важный нюанс для сайтов с платным контентом
Официальная документация Google Cloud по подготовке данных для Vertex AI Agent Search прямо указывает: боту нужен доступ к материалам сайта, включая контент за пейволлом — иначе агент не сможет полноценно проиндексировать и использовать эту информацию в ответах. Если ваш сайт (или сайт клиента) использует платную подписку и вы намеренно настраиваете Vertex AI Agent на этом контенте, стоит отдельно проверить, что правила robots.txt и структура подписки не блокируют доступ именно этому боту к закрытым материалам.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil — порядка 4,5 тысячи запросов. Учитывая owner-initiated природу краулинга, такой скромный и не растущий бесконтрольно объём — ожидаемая картина, а не повод для беспокойства.
Контроль
grep -i "Google-CloudVertexBot" /var/log/nginx/access.log
User-agent: Google-CloudVertexBot
Disallow: /
Рекомендации
- Сами строите Vertex AI Agent на своём контенте — Allow нужные пути; если используется платный контент, отдельно убедитесь, что пейволл не блокирует бота там, где это нужно для работы агента
- Чужой Vertex-краулинг не нужен — Disallow Google-CloudVertexBot, не трогая при этом правила для Googlebot Search без необходимости
- Помните: поскольку бот учитывает и общие правила для Googlebot, широкие изменения в этой секции robots.txt могут неожиданно затронуть и Google-CloudVertexBot — проверяйте пересечение правил перед публикацией
- Перед блокировкой уточните у команды или клиентов, не настроен ли именно ваш домен как источник данных для чьего-то Vertex AI Agent — бездумный Disallow может сломать чужой рабочий процесс, который вы сами не видите со стороны сервера
Частые вопросы
Может ли Google-CloudVertexBot зайти на сайт без чьей-либо настройки?
Стоит ли добавлять этот бот в robots.txt заранее, «на всякий случай»?
Что важно учесть, если сайт использует платный доступ к контенту?
Влияет ли Google-CloudVertexBot на обычную выдачу Google Search?
Как этот бот соотносится с правилами для Googlebot в robots.txt?
Что делать, если непонятно, зачем Google-CloudVertexBot заходит на сайт?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.