Gemini Deep Research — исследовательский AI-агент Google на базе Gemini. Его задача — не массово индексировать интернет ради классической поисковой выдачи, а выполнять многоэтапные исследования по запросу пользователя: составлять план, искать информацию, читать источники, сопоставлять данные и формировать подробный отчёт с цитатами.
Google официально описывает процесс Deep Research как:
Plan → Search → Read → Iterate → Output
То есть Deep Research — это прежде всего AI research agent, а не обычный поисковый crawler. :contentReference[oaicite:8]{index=8}
В серверных логах также наблюдается отдельный User-Agent с токеном:
Gemini-Deep-Research
Независимые каталоги фиксируют такую строку:
Mozilla/5.0 AppleWebKit/537.36
(KHTML, like Gecko; compatible; Gemini-Deep-Research;
+https://gemini.google/overview/deep-research/)
Chrome/135.0.0.0 Safari/537.36
Однако здесь важно сделать оговорку: на момент проверки Google не включает Gemini-Deep-Research в свой официальный публичный список common crawlers. Поэтому сам UA следует считать наблюдаемым идентификатором, а не достаточным доказательством подлинности запроса. :contentReference[oaicite:9]{index=9}
| Параметр | Значение |
|---|---|
| Название | Gemini Deep Research |
| Наблюдаемый UA | Gemini-Deep-Research |
| Оператор продукта | |
| Категория | AI Assistant / Deep Research |
| Основная функция | Поиск и чтение источников для выполнения исследовательской задачи |
| Массовый training crawler | Не подтверждено |
| Связь с Google Search | Deep Research использует Google Search как один из источников |
| Identity | Observed |
| Confidence TrafficVeil | Medium |
Как работает Gemini Deep Research
Deep Research отличается от обычного чат-ответа Gemini.
Вместо схемы:
Запрос → Ответ
агент выполняет более сложный цикл:
Запрос пользователя
↓
План исследования
↓
Поиск источников
↓
Чтение материалов
↓
Новые поисковые запросы
↓
Сопоставление данных
↓
Итоговый отчёт с источниками
Google указывает, что одна исследовательская задача может инициировать множество поисковых запросов и большой объём чтения. В Gemini API Deep Research доступен именно как отдельный agentic workflow, а не просто как ещё одна Gemini-модель. :contentReference[oaicite:10]{index=10}
Зачем Gemini Deep Research приходит на сайт
Наиболее логичный сценарий — конкретная страница оказалась полезным источником для исследования, которое выполняет пользователь Gemini.
Например, пользователь спрашивает Gemini:
Сравни современные системы защиты сайтов
и подготовь подробный отчёт.
Deep Research может выполнить серию поисковых запросов, обнаружить релевантные статьи, прочитать их и использовать полученные сведения при подготовке отчёта.
Google прямо говорит, что Deep Research предназначен для задач вроде:
- market analysis;
- due diligence;
- literature review;
- competitive landscape;
- других многоэтапных исследовательских задач.
Это значительно ближе к user-driven research retrieval, чем к классическому бесконечному crawling всего сайта. :contentReference[oaicite:11]{index=11}
Почему утверждение про fine-tuning было неточным
В исходном описании Gemini Deep Research был представлен как crawler, который собирает публичный контент для:
fine-tuning или inference pipeline LLM
Для самого Gemini-Deep-Research такая формулировка слишком широкая.
Google подтверждает другое назначение: агент ищет и читает информацию для выполнения исследовательской задачи и подготовки ответа. :contentReference[oaicite:12]{index=12}
У Google есть отдельный механизм для управления использованием контента при развитии Gemini — Google-Extended.
Google официально указывает, что Google-Extended позволяет веб-издателю контролировать, может ли собранный Google контент использоваться для:
- обучения будущих поколений Gemini;
- grounding Gemini Apps;
- grounding Gemini через Vertex AI.
То есть:
Gemini-Deep-Research ≠ Google-Extended
и эти механизмы нельзя смешивать. :contentReference[oaicite:13]{index=13}
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Gemini-Deep-Research и Google-Extended
| Gemini-Deep-Research | Google-Extended | |
|---|---|---|
| Что это | Наблюдаемый HTTP User-Agent research agent | robots.txt control token |
| Отдельный HTTP UA | Наблюдается | Нет |
| Основной сценарий | Получение источников для Deep Research | Управление использованием данных для Gemini training/grounding |
| Google Search indexing | Не является Googlebot | Не влияет на включение сайта в Google Search |
Google прямо подчёркивает, что Google-Extended не имеет отдельного HTTP User-Agent и не влияет на ранжирование или включение сайта в обычный Google Search. :contentReference[oaicite:14]{index=14}
Gemini Deep Research и Googlebot
Эти агенты также нельзя считать одним ботом.
| Параметр | Gemini Deep Research | Googlebot |
|---|---|---|
| Назначение | AI research | Google Search crawling |
| Тип активности | Research/read по задаче | Систематическое индексирование |
| Основной результат | AI-отчёт / ответ | Поисковый индекс |
| Органический Search | Не является основным crawler Search | Да |
Googlebot относится к официальным common crawlers Google и имеет опубликованные механизмы верификации. :contentReference[oaicite:15]{index=15}
Как найти Gemini Deep Research в access.log
Базовый поиск:
grep -i "gemini-deep-research" /var/log/nginx/access.log
Количество запросов:
grep -ic "gemini-deep-research" /var/log/nginx/access.log
Топ URL:
grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
Топ IP:
grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -rn \
| head -30
HTTP-коды:
grep -i "gemini-deep-research" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -rn
Как выглядит нормальный профиль Deep Research
Независимые системы наблюдения описывают Gemini-Deep-Research скорее как on-demand агент, чем как crawler, непрерывно обходящий весь сайт. Запросы могут возникать тогда, когда страница нужна для конкретного исследования. :contentReference[oaicite:16]{index=16}
| Признак | Ожидаемый research agent |
|---|---|
| URL | Релевантные конкретной теме страницы |
| Сессия | Нет обычного браузерного поведения пользователя |
| Конверсия | Отсутствует |
| Пути | Публичный информационный контент |
| Повторяемость | Зависит от исследовательских запросов пользователей |
Какие страницы могут быть интересны Deep Research
Это зависит от пользовательского вопроса, поэтому фиксированного списка директорий нет.
Research agent потенциально может обратиться к:
- статьям;
- исследованиям;
- новостям;
- документации;
- публичным продуктовым страницам;
- отчётам;
- справочным материалам.
Поэтому старое предположение о постоянном обходе:
/blog/
/product/
/category/
/news/
/api/
не стоит использовать как обязательный behavioral fingerprint.
Как проверить настоящий Gemini-Deep-Research
Здесь есть важная проблема: Google пока не описывает Gemini-Deep-Research в официальном crawler directory и не предоставляет для него отдельный публичный verification feed.
Google предупреждает в своей общей документации, что HTTP User-Agent может быть подделан. :contentReference[oaicite:17]{index=17}
Поэтому TrafficVeil должен использовать:
- User-Agent;
- IP;
- ASN;
- network organization;
- TLS fingerprint;
- HTTP fingerprint;
- частоту;
- набор URL;
- историю поведения.
Почему нельзя автоматически доверять google-похожему UA
Например:
User-Agent: Gemini-Deep-Research
GET /.env
GET /.git/config
GET /backup.sql
GET /wp-login.php
GET /phpmyadmin/
не соответствует нормальному research-сценарию.
В таком случае TrafficVeil должен пометить клиента как:
Gemini-Deep-Research UA spoofing / suspicious automation.
Observed Google agent и Verified Google crawler — не одно и то же
Для TrafficVeil здесь полезно использовать уровень confidence.
| Статус | Что означает |
|---|---|
| Observed | Обнаружен известный UA |
| Probable | Инфраструктура и поведение согласуются с Google |
| Verified | Источник прошёл официальную проверку Google |
| Spoofed | UA не соответствует инфраструктуре или поведению |
Пока Google не публикует официальный механизм идентификации конкретно для Gemini-Deep-Research, безопаснее не присваивать Verified только по имени.
robots.txt для Gemini Deep Research
Сторонние системы наблюдения ожидают соблюдение этим агентом robots.txt, но отдельной официальной спецификации Google для данного UA на момент проверки нет. :contentReference[oaicite:18]{index=18}
Если владелец сайта хочет объявить запрет:
User-agent: Gemini-Deep-Research
Disallow: /
Для частичной политики:
User-agent: Gemini-Deep-Research
Disallow: /account/
Disallow: /checkout/
Disallow: /internal/
Allow: /
После изменения стоит обязательно проверить access.log и убедиться, как агент фактически реагирует на директиву.
Не путайте это правило с Google-Extended
Если цель владельца сайта — отказаться от использования контента при развитии и grounding Gemini, Google официально предоставляет отдельный токен:
User-agent: Google-Extended
Disallow: /
Это не то же самое, что:
User-agent: Gemini-Deep-Research
Disallow: /
Первое — официальная политика Google для использования контента Gemini. Второе — правило для наблюдаемого research-agent UA. :contentReference[oaicite:19]{index=19}
Блокировка через Nginx
if ($http_user_agent ~* "Gemini-Deep-Research") {
return 403;
}
Это жёсткий UA-фильтр. Он остановит любой запрос с такой строкой, включая возможный spoofing.
Блокировка через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Gemini-Deep-Research [NC]
RewriteRule ^ - [F,L]
Стоит ли использовать Rate Limit
Если задача — сохранить потенциальную видимость в Deep Research, но ограничить нагрузку, Rate Limit может быть компромиссом.
Однако сначала стоит проверить сам профиль:
- какие URL получает агент;
- сколько запросов приходится на минуту;
- сколько уникальных страниц;
- каков bandwidth;
- сколько запросов доходит до origin;
- не выглядит ли источник поддельным.
Для user-driven research traffic постоянный высокий RPS по всему сайту был бы менее ожидаем, чем для традиционного crawler.
Что будет при блокировке Gemini Deep Research
Точечная блокировка Gemini-Deep-Research не равна блокировке Googlebot.
Поэтому она сама по себе не должна рассматриваться как запрет индексации Google Search.
Но если наблюдаемый агент действительно используется Deep Research для получения источников, блокировка потенциально может уменьшить вероятность непосредственного использования страницы в исследовательском AI-ответе или получения перехода через такую цитату. Независимые системы наблюдения именно так описывают назначение агента. :contentReference[oaicite:20]{index=20}
Есть ли от Gemini Deep Research польза владельцу сайта
Потенциальная польза отличается от классического SEO.
Это может быть:
- упоминание бренда в research report;
- цитирование страницы;
- ссылка на источник;
- переход пользователя из AI-отчёта;
- видимость экспертного контента в AI-assisted research.
Но это не следует обещать как гарантированный результат каждого визита.
Как учитывать трафик в аналитике
Gemini Deep Research — автоматизированный трафик.
Для TrafficVeil логично использовать:
Automated Traffic → AI Assistants → Deep Research → Gemini
Рекомендуется:
- исключать из Human Traffic;
- не считать конверсией;
- не относить автоматически к malicious bots;
- показывать отдельно в AI traffic;
- сохранять Top URLs;
- показывать IP/ASN;
- отслеживать bandwidth и origin load.
С кем не путать Gemini Deep Research
| Агент | Назначение |
|---|---|
| Gemini-Deep-Research | AI research retrieval |
| Googlebot | Google Search crawling |
| Google-Extended | AI usage control token |
| GoogleOther | Общий crawler Google для различных продуктов/R&D |
| Google-CloudVertexBot | Site-owner initiated Vertex AI crawling |
Google официально документирует Googlebot, GoogleOther, Google-CloudVertexBot и Google-Extended как разные сущности с разными функциями. :contentReference[oaicite:21]{index=21}
Как классифицировать Gemini Deep Research в TrafficVeil
| Поле | Рекомендуемое значение |
|---|---|
| Name | Gemini Deep Research |
| UA token | Gemini-Deep-Research |
| Product operator | |
| Category | AI Assistant / Deep Research |
| Access model | User/agent-driven research retrieval |
| Identity | Observed |
| Confidence | Medium |
| Official dedicated IP feed | Not documented |
| Default action | Monitor / Allow |
| Human analytics | Exclude |
| AI analytics | Include |
Стратегия Allow / Monitor / Block
| Ситуация | Рекомендация |
|---|---|
| Хотите присутствовать в AI research answers | Allow / Monitor |
| Источник выглядит нормальным, но identity не подтверждён | Monitor |
| Нагрузка слишком высокая | Verify → Rate Limit |
| Не хотите отдавать контент этому агенту | Disallow / Block |
| Нужно ограничить AI training/grounding Google | Настраивать также Google-Extended |
| UA используется для vulnerability scanning | Block как spoofing |
Что показывать пользователю TrafficVeil
Вместо:
«Нежелательный AI crawler. Рекомендуется Deny.»
лучше выводить более точное описание:
Gemini Deep Research — AI research agent Google. Он может получать публичные страницы для подготовки исследовательских ответов по запросу пользователя. Это не Googlebot и не отдельный training crawler. Разрешите его, если вам важна видимость и цитирование в Gemini Deep Research; ограничьте, если такой доступ не нужен.
Итог
Gemini Deep Research — не обычный массовый LLM-training crawler. Google официально описывает Deep Research как AI-агента, который планирует исследование, ищет, читает источники и синтезирует подробные отчёты. :contentReference[oaicite:22]{index=22}
User-Agent Gemini-Deep-Research наблюдается независимыми bot-каталогами и связывается с этим research-сценарием, однако отдельного официального crawler entry и выделенного verification feed Google для него на момент проверки нет. Поэтому TrafficVeil правильнее использовать статус Observed / Medium confidence, а не безусловный Verified. :contentReference[oaicite:23]{index=23}
Для владельца сайта решение зависит от цели. Если важна потенциальная видимость и цитирование в AI-assisted research — Allow/Monitor. Если такой тип автоматического получения контента не нужен — можно использовать отдельное ограничение.
И главное: не смешивайте Gemini-Deep-Research, Googlebot и Google-Extended. Это три разных механизма с разным назначением и разными последствиями блокировки.
Частые вопросы
Что такое Gemini Deep Research?
Использует ли Gemini Deep Research сайты для обучения моделей?
Кто оператор Gemini-Deep-Research?
Это тот же бот, что Googlebot?
Чем Gemini-Deep-Research отличается от Google-Extended?
Нужно ли блокировать Gemini Deep Research?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.