Боты6 мин чтения·10 августа 2026 г.

Gemini Deep Research — что это за бот Google и нужно ли блокировать

Что такое Gemini-Deep-Research, зачем агент Google получает страницы, чем отличается от Googlebot и Google-Extended и как настроить Allow, Monitor или Block.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Gemini Deep Research: нежелательный ai и llm-краулеры

Gemini Deep Research — исследовательский AI-агент Google на базе Gemini. Его задача — не массово индексировать интернет ради классической поисковой выдачи, а выполнять многоэтапные исследования по запросу пользователя: составлять план, искать информацию, читать источники, сопоставлять данные и формировать подробный отчёт с цитатами.

Google официально описывает процесс Deep Research как:

Plan → Search → Read → Iterate → Output

То есть Deep Research — это прежде всего AI research agent, а не обычный поисковый crawler. :contentReference[oaicite:8]{index=8}

В серверных логах также наблюдается отдельный User-Agent с токеном:

Gemini-Deep-Research

Независимые каталоги фиксируют такую строку:

Mozilla/5.0 AppleWebKit/537.36
(KHTML, like Gecko; compatible; Gemini-Deep-Research;
+https://gemini.google/overview/deep-research/)
Chrome/135.0.0.0 Safari/537.36

Однако здесь важно сделать оговорку: на момент проверки Google не включает Gemini-Deep-Research в свой официальный публичный список common crawlers. Поэтому сам UA следует считать наблюдаемым идентификатором, а не достаточным доказательством подлинности запроса. :contentReference[oaicite:9]{index=9}

Параметр Значение
Название Gemini Deep Research
Наблюдаемый UA Gemini-Deep-Research
Оператор продукта Google
Категория AI Assistant / Deep Research
Основная функция Поиск и чтение источников для выполнения исследовательской задачи
Массовый training crawler Не подтверждено
Связь с Google Search Deep Research использует Google Search как один из источников
Identity Observed
Confidence TrafficVeil Medium

Как работает Gemini Deep Research

Deep Research отличается от обычного чат-ответа Gemini.

Вместо схемы:

Запрос → Ответ

агент выполняет более сложный цикл:

Запрос пользователя
↓
План исследования
↓
Поиск источников
↓
Чтение материалов
↓
Новые поисковые запросы
↓
Сопоставление данных
↓
Итоговый отчёт с источниками

Google указывает, что одна исследовательская задача может инициировать множество поисковых запросов и большой объём чтения. В Gemini API Deep Research доступен именно как отдельный agentic workflow, а не просто как ещё одна Gemini-модель. :contentReference[oaicite:10]{index=10}

Зачем Gemini Deep Research приходит на сайт

Наиболее логичный сценарий — конкретная страница оказалась полезным источником для исследования, которое выполняет пользователь Gemini.

Например, пользователь спрашивает Gemini:

Сравни современные системы защиты сайтов
и подготовь подробный отчёт.

Deep Research может выполнить серию поисковых запросов, обнаружить релевантные статьи, прочитать их и использовать полученные сведения при подготовке отчёта.

Google прямо говорит, что Deep Research предназначен для задач вроде:

  • market analysis;
  • due diligence;
  • literature review;
  • competitive landscape;
  • других многоэтапных исследовательских задач.

Это значительно ближе к user-driven research retrieval, чем к классическому бесконечному crawling всего сайта. :contentReference[oaicite:11]{index=11}

Почему утверждение про fine-tuning было неточным

В исходном описании Gemini Deep Research был представлен как crawler, который собирает публичный контент для:

fine-tuning или inference pipeline LLM

Для самого Gemini-Deep-Research такая формулировка слишком широкая.

Google подтверждает другое назначение: агент ищет и читает информацию для выполнения исследовательской задачи и подготовки ответа. :contentReference[oaicite:12]{index=12}

У Google есть отдельный механизм для управления использованием контента при развитии Gemini — Google-Extended.

Google официально указывает, что Google-Extended позволяет веб-издателю контролировать, может ли собранный Google контент использоваться для:

  • обучения будущих поколений Gemini;
  • grounding Gemini Apps;
  • grounding Gemini через Vertex AI.

То есть:

Gemini-Deep-Research ≠ Google-Extended

и эти механизмы нельзя смешивать. :contentReference[oaicite:13]{index=13}

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Gemini-Deep-Research и Google-Extended

  Gemini-Deep-Research Google-Extended
Что это Наблюдаемый HTTP User-Agent research agent robots.txt control token
Отдельный HTTP UA Наблюдается Нет
Основной сценарий Получение источников для Deep Research Управление использованием данных для Gemini training/grounding
Google Search indexing Не является Googlebot Не влияет на включение сайта в Google Search

Google прямо подчёркивает, что Google-Extended не имеет отдельного HTTP User-Agent и не влияет на ранжирование или включение сайта в обычный Google Search. :contentReference[oaicite:14]{index=14}

Gemini Deep Research и Googlebot

Эти агенты также нельзя считать одним ботом.

Параметр Gemini Deep Research Googlebot
Назначение AI research Google Search crawling
Тип активности Research/read по задаче Систематическое индексирование
Основной результат AI-отчёт / ответ Поисковый индекс
Органический Search Не является основным crawler Search Да

Googlebot относится к официальным common crawlers Google и имеет опубликованные механизмы верификации. :contentReference[oaicite:15]{index=15}

Как найти Gemini Deep Research в access.log

Базовый поиск:

grep -i "gemini-deep-research" /var/log/nginx/access.log

Количество запросов:

grep -ic "gemini-deep-research" /var/log/nginx/access.log

Топ URL:

grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

Топ IP:

grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30

HTTP-коды:

grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn

Как выглядит нормальный профиль Deep Research

Независимые системы наблюдения описывают Gemini-Deep-Research скорее как on-demand агент, чем как crawler, непрерывно обходящий весь сайт. Запросы могут возникать тогда, когда страница нужна для конкретного исследования. :contentReference[oaicite:16]{index=16}

Признак Ожидаемый research agent
URL Релевантные конкретной теме страницы
Сессия Нет обычного браузерного поведения пользователя
Конверсия Отсутствует
Пути Публичный информационный контент
Повторяемость Зависит от исследовательских запросов пользователей

Какие страницы могут быть интересны Deep Research

Это зависит от пользовательского вопроса, поэтому фиксированного списка директорий нет.

Research agent потенциально может обратиться к:

  • статьям;
  • исследованиям;
  • новостям;
  • документации;
  • публичным продуктовым страницам;
  • отчётам;
  • справочным материалам.

Поэтому старое предположение о постоянном обходе:

/blog/
/product/
/category/
/news/
/api/

не стоит использовать как обязательный behavioral fingerprint.

Как проверить настоящий Gemini-Deep-Research

Здесь есть важная проблема: Google пока не описывает Gemini-Deep-Research в официальном crawler directory и не предоставляет для него отдельный публичный verification feed.

Google предупреждает в своей общей документации, что HTTP User-Agent может быть подделан. :contentReference[oaicite:17]{index=17}

Поэтому TrafficVeil должен использовать:

  • User-Agent;
  • IP;
  • ASN;
  • network organization;
  • TLS fingerprint;
  • HTTP fingerprint;
  • частоту;
  • набор URL;
  • историю поведения.

Почему нельзя автоматически доверять google-похожему UA

Например:

User-Agent: Gemini-Deep-Research

GET /.env
GET /.git/config
GET /backup.sql
GET /wp-login.php
GET /phpmyadmin/

не соответствует нормальному research-сценарию.

В таком случае TrafficVeil должен пометить клиента как:

Gemini-Deep-Research UA spoofing / suspicious automation.

Observed Google agent и Verified Google crawler — не одно и то же

Для TrafficVeil здесь полезно использовать уровень confidence.

Статус Что означает
Observed Обнаружен известный UA
Probable Инфраструктура и поведение согласуются с Google
Verified Источник прошёл официальную проверку Google
Spoofed UA не соответствует инфраструктуре или поведению

Пока Google не публикует официальный механизм идентификации конкретно для Gemini-Deep-Research, безопаснее не присваивать Verified только по имени.

robots.txt для Gemini Deep Research

Сторонние системы наблюдения ожидают соблюдение этим агентом robots.txt, но отдельной официальной спецификации Google для данного UA на момент проверки нет. :contentReference[oaicite:18]{index=18}

Если владелец сайта хочет объявить запрет:

User-agent: Gemini-Deep-Research
Disallow: /

Для частичной политики:

User-agent: Gemini-Deep-Research
Disallow: /account/
Disallow: /checkout/
Disallow: /internal/
Allow: /

После изменения стоит обязательно проверить access.log и убедиться, как агент фактически реагирует на директиву.

Не путайте это правило с Google-Extended

Если цель владельца сайта — отказаться от использования контента при развитии и grounding Gemini, Google официально предоставляет отдельный токен:

User-agent: Google-Extended
Disallow: /

Это не то же самое, что:

User-agent: Gemini-Deep-Research
Disallow: /

Первое — официальная политика Google для использования контента Gemini. Второе — правило для наблюдаемого research-agent UA. :contentReference[oaicite:19]{index=19}

Блокировка через Nginx

if ($http_user_agent ~* "Gemini-Deep-Research") {
    return 403;
}

Это жёсткий UA-фильтр. Он остановит любой запрос с такой строкой, включая возможный spoofing.

Блокировка через Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Gemini-Deep-Research [NC]
RewriteRule ^ - [F,L]

Стоит ли использовать Rate Limit

Если задача — сохранить потенциальную видимость в Deep Research, но ограничить нагрузку, Rate Limit может быть компромиссом.

Однако сначала стоит проверить сам профиль:

  1. какие URL получает агент;
  2. сколько запросов приходится на минуту;
  3. сколько уникальных страниц;
  4. каков bandwidth;
  5. сколько запросов доходит до origin;
  6. не выглядит ли источник поддельным.

Для user-driven research traffic постоянный высокий RPS по всему сайту был бы менее ожидаем, чем для традиционного crawler.

Что будет при блокировке Gemini Deep Research

Точечная блокировка Gemini-Deep-Research не равна блокировке Googlebot.

Поэтому она сама по себе не должна рассматриваться как запрет индексации Google Search.

Но если наблюдаемый агент действительно используется Deep Research для получения источников, блокировка потенциально может уменьшить вероятность непосредственного использования страницы в исследовательском AI-ответе или получения перехода через такую цитату. Независимые системы наблюдения именно так описывают назначение агента. :contentReference[oaicite:20]{index=20}

Есть ли от Gemini Deep Research польза владельцу сайта

Потенциальная польза отличается от классического SEO.

Это может быть:

  • упоминание бренда в research report;
  • цитирование страницы;
  • ссылка на источник;
  • переход пользователя из AI-отчёта;
  • видимость экспертного контента в AI-assisted research.

Но это не следует обещать как гарантированный результат каждого визита.

Как учитывать трафик в аналитике

Gemini Deep Research — автоматизированный трафик.

Для TrafficVeil логично использовать:

Automated Traffic → AI Assistants → Deep Research → Gemini

Рекомендуется:

  • исключать из Human Traffic;
  • не считать конверсией;
  • не относить автоматически к malicious bots;
  • показывать отдельно в AI traffic;
  • сохранять Top URLs;
  • показывать IP/ASN;
  • отслеживать bandwidth и origin load.

С кем не путать Gemini Deep Research

Агент Назначение
Gemini-Deep-Research AI research retrieval
Googlebot Google Search crawling
Google-Extended AI usage control token
GoogleOther Общий crawler Google для различных продуктов/R&D
Google-CloudVertexBot Site-owner initiated Vertex AI crawling

Google официально документирует Googlebot, GoogleOther, Google-CloudVertexBot и Google-Extended как разные сущности с разными функциями. :contentReference[oaicite:21]{index=21}

Как классифицировать Gemini Deep Research в TrafficVeil

Поле Рекомендуемое значение
Name Gemini Deep Research
UA token Gemini-Deep-Research
Product operator Google
Category AI Assistant / Deep Research
Access model User/agent-driven research retrieval
Identity Observed
Confidence Medium
Official dedicated IP feed Not documented
Default action Monitor / Allow
Human analytics Exclude
AI analytics Include

Стратегия Allow / Monitor / Block

Ситуация Рекомендация
Хотите присутствовать в AI research answers Allow / Monitor
Источник выглядит нормальным, но identity не подтверждён Monitor
Нагрузка слишком высокая Verify → Rate Limit
Не хотите отдавать контент этому агенту Disallow / Block
Нужно ограничить AI training/grounding Google Настраивать также Google-Extended
UA используется для vulnerability scanning Block как spoofing

Что показывать пользователю TrafficVeil

Вместо:

«Нежелательный AI crawler. Рекомендуется Deny.»

лучше выводить более точное описание:

Gemini Deep Research — AI research agent Google. Он может получать публичные страницы для подготовки исследовательских ответов по запросу пользователя. Это не Googlebot и не отдельный training crawler. Разрешите его, если вам важна видимость и цитирование в Gemini Deep Research; ограничьте, если такой доступ не нужен.

Итог

Gemini Deep Research — не обычный массовый LLM-training crawler. Google официально описывает Deep Research как AI-агента, который планирует исследование, ищет, читает источники и синтезирует подробные отчёты. :contentReference[oaicite:22]{index=22}

User-Agent Gemini-Deep-Research наблюдается независимыми bot-каталогами и связывается с этим research-сценарием, однако отдельного официального crawler entry и выделенного verification feed Google для него на момент проверки нет. Поэтому TrafficVeil правильнее использовать статус Observed / Medium confidence, а не безусловный Verified. :contentReference[oaicite:23]{index=23}

Для владельца сайта решение зависит от цели. Если важна потенциальная видимость и цитирование в AI-assisted research — Allow/Monitor. Если такой тип автоматического получения контента не нужен — можно использовать отдельное ограничение.

И главное: не смешивайте Gemini-Deep-Research, Googlebot и Google-Extended. Это три разных механизма с разным назначением и разными последствиями блокировки.

Частые вопросы

Что такое Gemini Deep Research?
Gemini Deep Research — агент Google на базе Gemini, который самостоятельно планирует многоэтапное исследование, выполняет поиск, читает источники и синтезирует подробный отчёт с цитатами. Google прямо описывает workflow как Plan → Search → Read → Iterate → Output.
Использует ли Gemini Deep Research сайты для обучения моделей?
Не следует утверждать это про сам Gemini-Deep-Research. Публично подтверждённая функция Deep Research — поиск и чтение источников для выполнения конкретной исследовательской задачи. Отдельное управление использованием контента для обучения будущих моделей Gemini у Google реализовано через Google-Extended.
Кто оператор Gemini-Deep-Research?
Функция Gemini Deep Research принадлежит Google. Однако конкретный HTTP UA Gemini-Deep-Research пока не описан в официальном каталоге Google crawlers; его фиксируют независимые bot-каталоги. Поэтому связь с Google выглядит сильной, но TrafficVeil не должен выдавать статус Verified только по строке UA.
Это тот же бот, что Googlebot?
Нет. Googlebot отвечает за crawling Google Search. Gemini Deep Research выполняет исследовательскую задачу и обращается к источникам в контексте AI-ответа. Блокировка одного UA Gemini-Deep-Research сама по себе не равна блокировке Googlebot.
Чем Gemini-Deep-Research отличается от Google-Extended?
Google-Extended вообще не имеет отдельного HTTP User-Agent. Это robots.txt-токен, который управляет использованием уже собранного Google контента для обучения будущих моделей Gemini и grounding-сценариев. Gemini-Deep-Research, напротив, наблюдается как отдельный HTTP-клиент, связанный с исследовательскими запросами.
Нужно ли блокировать Gemini Deep Research?
Не обязательно. Если сайту полезны переходы и цитирования из AI-ответов, разумнее Allow/Monitor. Если владелец не хочет предоставлять контент этому типу AI-assistant fetch, можно применить отдельное ограничение. При этом сначала стоит убедиться, что запрос действительно соответствует ожидаемому профилю, поскольку UA подделывается.
#Gemini Deep Research#Gemini-Deep-Research#Google Gemini#Gemini crawler#AI Assistant#AI crawler#Google AI#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil