Кто-то в чужом Google-документе сослался на вашу страницу — и вот уже в access.log регулярно всплывает токен googledocs. Это не совпадение: за визитами GoogleDocs почти всегда стоит конкретное действие конкретного пользователя внутри Google Docs, Sheets или Slides, а не фоновая индексация вашего сайта.
Что такое GoogleDocs
| Параметр | Значение |
|---|---|
| Название | GoogleDocs |
| User-Agent / паттерн | googledocs |
| Оператор | |
| Роль | Подгружает содержимое внешней страницы, когда пользователь ссылается на неё или встраивает её данные в Google Docs, Sheets или Slides — для живых ссылок, превью-чипов и формул импорта данных |
| Документация / ориентир | Прямо в отдельной статье developers.google.com не выделен, но по механике поведения относится к семейству user-triggered fetchers Google (та же категория, что Feedfetcher, Google-Agent, Google Site Verifier) |
| Список IP | Google публикует диапазоны для всего семейства user-triggered fetchers в user-triggered-fetchers.json / user-triggered-agents.json; обратный DNS для этой категории обычно оканчивается на *.gae.googleusercontent.com или google-proxy-*.google.com |
| robots.txt | Как и у других user-triggered fetchers, соблюдение директив для запросов, инициированных конкретным пользователем, не гарантировано так же строго, как у автономных краулеров вроде Googlebot |
| Пометка TrafficVeil | Легитимный / Прочие краулеры и сервисы |
Зачем GoogleDocs приходит на сайт
Механизм простой: пользователь вставляет вашу ссылку в документ, таблицу или презентацию — и Google подгружает содержимое страницы, чтобы показать превью, живую ссылку или данные, обновляющиеся в реальном времени.
- Какие зоны чаще трогает: конкретные страницы, на которые кто-то сослался — не сайт целиком
- Что ищет: контент и метаданные страницы для отображения внутри документа пользователя
- Чем отличается от браузерного пользователя: нет обычной сессии, запрос происходит один раз в момент действия пользователя в Google-документе, а не по расписанию
Типичный кейс: ночью RPS растёт, конверсий нет. В access.log виден googledocs на конкретных страницах — но, в отличие от автономных ботов, у такого всплеска почти всегда есть конкретный триггер: кто-то именно в этот момент работал с документом, ссылающимся на ваш сайт.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у googledocs может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на конкретных страницах, а не на служебных разделах — точечность запросов здесь особенно показательна.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти GoogleDocs в логах
# Базовый поиск
grep -i "googledocs" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "googledocs" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Подделать User-Agent может любой скрипт, но для этой категории у Google есть более надёжные ориентиры, чем просто строка UA:
- Сверяйте IP с диапазонами в user-triggered-fetchers.json / user-triggered-agents.json
- Проверяйте обратный DNS — легитимные запросы этой категории обычно резолвятся в *.gae.googleusercontent.com или google-proxy-*.google.com
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для GoogleDocs
# Жёсткий запрет
User-agent: googledocs
Disallow: /
# Разрешить всё
User-agent: googledocs
Allow: /
# Компромисс: закрыть служебные разделы, оставить публичку
User-agent: googledocs
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: поскольку запрос инициирован конкретным пользователем, а не автономным решением Google, полагаться только на robots.txt рискованно — как и с другими user-triggered fetchers, для гарантированного контроля лучше дополнительно использовать серверные правила.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "googledocs") {
return 403;
}
limit_req_zone $binary_remote_addr zone=googledocs:10m rate=10r/m;
location / {
if ($http_user_agent ~* "googledocs") {
limit_req zone=googledocs burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} googledocs [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите googledocs / GoogleDocs в ботах домена или в /system/bots
- Для мягкого сценария rate-limit подойдёт лучше жёсткого запрета — трафик обычно и так точечный
- Allow — если нет причин мешать пользователям, ссылающимся на ваш контент из своих документов
- После изменения сверьте логи: хиты googledocs должны уйти в блок/лимит, а поисковики Google/Yandex остаться без изменений
Рекомендации: что делать с GoogleDocs
- Нет причин ограничивать доступ к публичному контенту — можно оставить allow, критичного риска для сайта нет
- Нагрузка мешает — сначала rate-limit, затем полный запрет, но учитывая природу трафика жёсткая блокировка редко оправдана
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с googledocs - Что будет при блокировке: обычно ничего критичного для SEO не теряете, но пользователи, ссылающиеся на вас из документов, перестанут видеть живое превью или актуальные данные
Частые вопросы
С чего вообще начинается визит GoogleDocs на сайт?
Значит ли это, что кто-то целенаправленно собирает данные с моего сайта?
Публикует ли Google список IP для проверки подлинности такого трафика?
Можно ли доверять только robots.txt для ограничения доступа GoogleDocs?
Что произойдёт с чужими документами, если заблокировать GoogleDocs?
Стоит ли блокировать GoogleDocs, если нагрузка минимальна?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.