Боты5 мин чтения·7 августа 2026 г.

Кто-то сослался на вас в Google Docs — отсюда и трафик GoogleDocs в логах

Разбираем, как встраивание ссылки в чужой документ или таблицу превращается в строку googledocs в access.log, и почему это не похоже на типичный автоматический обход.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота GoogleDocs: легитимный прочие краулеры и сервисы

Кто-то в чужом Google-документе сослался на вашу страницу — и вот уже в access.log регулярно всплывает токен googledocs. Это не совпадение: за визитами GoogleDocs почти всегда стоит конкретное действие конкретного пользователя внутри Google Docs, Sheets или Slides, а не фоновая индексация вашего сайта.

Что такое GoogleDocs

Параметр Значение
Название GoogleDocs
User-Agent / паттерн googledocs
Оператор Google
Роль Подгружает содержимое внешней страницы, когда пользователь ссылается на неё или встраивает её данные в Google Docs, Sheets или Slides — для живых ссылок, превью-чипов и формул импорта данных
Документация / ориентир Прямо в отдельной статье developers.google.com не выделен, но по механике поведения относится к семейству user-triggered fetchers Google (та же категория, что Feedfetcher, Google-Agent, Google Site Verifier)
Список IP Google публикует диапазоны для всего семейства user-triggered fetchers в user-triggered-fetchers.json / user-triggered-agents.json; обратный DNS для этой категории обычно оканчивается на *.gae.googleusercontent.com или google-proxy-*.google.com
robots.txt Как и у других user-triggered fetchers, соблюдение директив для запросов, инициированных конкретным пользователем, не гарантировано так же строго, как у автономных краулеров вроде Googlebot
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Зачем GoogleDocs приходит на сайт

Механизм простой: пользователь вставляет вашу ссылку в документ, таблицу или презентацию — и Google подгружает содержимое страницы, чтобы показать превью, живую ссылку или данные, обновляющиеся в реальном времени.

  • Какие зоны чаще трогает: конкретные страницы, на которые кто-то сослался — не сайт целиком
  • Что ищет: контент и метаданные страницы для отображения внутри документа пользователя
  • Чем отличается от браузерного пользователя: нет обычной сессии, запрос происходит один раз в момент действия пользователя в Google-документе, а не по расписанию

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log виден googledocs на конкретных страницах — но, в отличие от автономных ботов, у такого всплеска почти всегда есть конкретный триггер: кто-то именно в этот момент работал с документом, ссылающимся на ваш сайт.

Нагрузка и риски

Отдельной строки в публичной сводке top-bot TrafficVeil у googledocs может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на конкретных страницах, а не на служебных разделах — точечность запросов здесь особенно показательна.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти GoogleDocs в логах

# Базовый поиск
grep -i "googledocs" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация

Подделать User-Agent может любой скрипт, но для этой категории у Google есть более надёжные ориентиры, чем просто строка UA:

  • Сверяйте IP с диапазонами в user-triggered-fetchers.json / user-triggered-agents.json
  • Проверяйте обратный DNS — легитимные запросы этой категории обычно резолвятся в *.gae.googleusercontent.com или google-proxy-*.google.com
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для GoogleDocs

# Жёсткий запрет
User-agent: googledocs
Disallow: /

# Разрешить всё
User-agent: googledocs
Allow: /

# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: googledocs
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: поскольку запрос инициирован конкретным пользователем, а не автономным решением Google, полагаться только на robots.txt рискованно — как и с другими user-triggered fetchers, для гарантированного контроля лучше дополнительно использовать серверные правила.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "googledocs") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=googledocs:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "googledocs") {
        limit_req zone=googledocs burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} googledocs [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите googledocs / GoogleDocs в ботах домена или в /system/bots
  • Для мягкого сценария rate-limit подойдёт лучше жёсткого запрета — трафик обычно и так точечный
  • Allow — если нет причин мешать пользователям, ссылающимся на ваш контент из своих документов
  • После изменения сверьте логи: хиты googledocs должны уйти в блок/лимит, а поисковики Google/Yandex остаться без изменений

Рекомендации: что делать с GoogleDocs

  • Нет причин ограничивать доступ к публичному контенту — можно оставить allow, критичного риска для сайта нет
  • Нагрузка мешает — сначала rate-limit, затем полный запрет, но учитывая природу трафика жёсткая блокировка редко оправдана
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с googledocs
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете, но пользователи, ссылающиеся на вас из документов, перестанут видеть живое превью или актуальные данные

Частые вопросы

С чего вообще начинается визит GoogleDocs на сайт?
С того, что кто-то вставил ссылку на вашу страницу в свой Google-документ, таблицу или презентацию.
Значит ли это, что кто-то целенаправленно собирает данные с моего сайта?
Нет, это разовая подгрузка конкретной страницы ради превью или живых данных внутри чужого документа, а не системный сбор контента.
Публикует ли Google список IP для проверки подлинности такого трафика?
Да, диапазоны для этой категории входят в общие файлы user-triggered-fetchers.json и user-triggered-agents.json, которые Google ведёт для всех подобных сервисов.
Можно ли доверять только robots.txt для ограничения доступа GoogleDocs?
Не полностью — как и у других сервисов, запускаемых действием пользователя, гарантии строгого соблюдения директив меньше, чем у Googlebot.
Что произойдёт с чужими документами, если заблокировать GoogleDocs?
Пользователи, ссылающиеся на вашу страницу, перестанут видеть актуальное превью или обновляемые данные в своих файлах.
Стоит ли блокировать GoogleDocs, если нагрузка минимальна?
Обычно нет смысла — трафик и так точечный, а блокировка скорее ухудшит опыт тех, кто ссылается на ваш контент, чем сэкономит ресурсы.
#GoogleDocs#Google Sheets#Google Slides#user-triggered fetcher#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil