В отличие от основного Googlebot, который может индексировать страницу спустя дни или недели, Googlebot-News работает в режиме близком к реальному времени — новые материалы могут появиться в Google News в течение нескольких минут после публикации.
Понимание работы этого краулера критически важно для новостных изданий, блогов, медиапорталов и любых сайтов, которые хотят получать трафик из Google News и Top Stories.
1. Что такое Googlebot-News
1.1 User-Agent строка
Googlebot-News
# Полная строка:
Mozilla/5.0 (compatible; Googlebot-News; +http://www.google.com/bot.html)
1.2 Место в экосистеме Google-ботов
| Краулер | Зона ответственности | Скорость индексации |
|---|---|---|
| Googlebot (Desktop/Mobile) | Основной поиск, общая индексация | Часы — недели |
| Googlebot-News | Google News, Discover, Top Stories | Минуты — часы |
| Googlebot-Image | Google Images | Часы — дни |
| Google-InspectionTool | Ручная инспекция в Search Console | По запросу |
1.3 Куда попадает контент
| Поверхность | Описание | Требования |
|---|---|---|
| Google News (news.google.com) | Новостной агрегатор | Одобрение в Google News |
| Top Stories (поисковая выдача) | Карусель новостей в Google Search | AMP или Web Stories рекомендуется |
| Google Discover | Лента рекомендаций на Android/iOS | Качественный контент, хорошие E-E-A-T сигналы |
| Google Search (основной) | Обычная выдача | Стандартная SEO-оптимизация |
1.4 IP-адреса
Googlebot-News использует те же IP-диапазоны Google (AS15169), что и основной Googlebot. Актуальный список публикуется по адресу:
https://developers.google.com/search/apis/ipranges/googlebot.json
⚠ Около 90% запросов с User-Agent «Googlebot-News» в логах — поддельные боты. Единственный надёжный способ проверки — двухэтапная DNS-верификация (reverse + forward lookup на crawl-*.googlebot.com).
2. Как работает Googlebot-News
2.1 Этапы обхода
- Google News crawler непрерывно мониторит RSS/Atom-фиды и News Sitemap зарегистрированных изданий.
- При обнаружении новой записи URL добавляется в приоритетную очередь.
- Googlebot-News скачивает страницу в течение нескольких минут после публикации.
- Анализируется контент: заголовок, дата публикации, автор, тело статьи.
- Проверяются сигналы качества: уникальность, авторитетность, E-E-A-T.
- Статья добавляется в индекс Google News и может появиться в Top Stories.
2.2 Что Googlebot-News анализирует
| Элемент | Что извлекается | Важность |
|---|---|---|
Заголовок статьи (<h1>, <title>) |
Основная тема материала | ⭐⭐⭐⭐⭐ Критически важно |
| Дата публикации | Свежесть контента | ⭐⭐⭐⭐⭐ Критически важно |
| Автор материала | E-E-A-T сигналы авторства | ⭐⭐⭐⭐ Очень важно |
| Тело статьи | Уникальность, глубина, релевантность | ⭐⭐⭐⭐⭐ Критически важно |
| News Sitemap | Метаданные новости | ⭐⭐⭐⭐ Очень важно |
| Schema.org NewsArticle | Структурированные данные | ⭐⭐⭐⭐ Очень важно |
| Canonical URL | Оригинальный источник | ⭐⭐⭐⭐ Очень важно |
Язык материала (hreflang) |
Геотаргетинг новости | ⭐⭐⭐ Важно |
| Изображение статьи | Превью в Top Stories / Discover | ⭐⭐⭐⭐ Очень важно |
| Paywalled контент | Наличие paywall-разметки | ⭐⭐⭐ Важно |
2.3 Ключевое отличие: скорость
Googlebot-News работает принципиально иначе, чем основной Googlebot:
- Основной Googlebot — обходит сайт по расписанию, приоритет определяется PageRank и crawl budget. Новая страница может ждать индексации дни и недели.
- Googlebot-News — реагирует на публикацию почти в реальном времени. Новость может появиться в Google News через 2–5 минут после выхода.
Это делает News Sitemap и RSS-фиды критически важными инструментами для новостных изданий.
3. Технические требования для Google News
3.1 Требования к сайту
| Требование | Детали |
|---|---|
| Регистрация в Google News | Через Google Publisher Center (publishercenter.google.com) |
| Уникальный оригинальный контент | Без агрегации чужих материалов без добавленной ценности |
| Чёткая структура сайта | Отдельные URL для каждой статьи, понятная навигация |
| Дата и автор на странице | Машиночитаемая дата (schema.org или <time>) |
| Страница «О редакции» | Информация об авторах, контактные данные, политика редакции |
| Политика конфиденциальности | Обязательна |
| HTTPS | Обязателен |
3.2 Требования к статьям
- Уникальный URL для каждой статьи, не изменяющийся после публикации
- Заголовок — не кликбейт, соответствует содержанию
- Дата публикации и дата последнего обновления
- Имя автора (или редакции) на странице
- Минимум один абзац оригинального текста
- Изображение не менее 1200px по ширине для Top Stories
- Контент не должен нарушать Google News Content Policies
3.3 News Sitemap — обязательный инструмент
News Sitemap — расширение стандартного sitemap.xml, специально предназначенное для новостных сайтов. Это главный сигнал для Googlebot-News о новых публикациях.
Ключевые правила News Sitemap:
- Включать только статьи, опубликованные за последние 2 дня (48 часов)
- Максимум 1 000 URL в одном файле
- Обновлять при каждой новой публикации
- Указывать в robots.txt или Google Search Console
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"
xmlns:news="http://www.google.com/schemas/sitemap-news/0.9">
<url>
<loc>https://example.com/news/article-slug/</loc>
<news:news>
<news:publication>
<news:name>Название издания</news:name>
<news:language>ru</news:language>
</news:publication>
<news:publication_date>2026-05-08T14:30:00+03:00</news:publication_date>
<news:title>Заголовок новости точно как в статье</news:title>
<news:keywords>ключевое слово, тема, категория</news:keywords>
</news:news>
</url>
</urlset>
Регистрация sitemap в robots.txt:
Sitemap: https://example.com/news-sitemap.xml
3.4 Schema.org NewsArticle
Структурированные данные — обязательный элемент для попадания в Top Stories и Google Discover с расширенным сниппетом:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "NewsArticle",
"headline": "Заголовок статьи (до 110 символов)",
"description": "Краткое описание материала для превью",
"image": {
"@type": "ImageObject",
"url": "https://example.com/images/article-cover.jpg",
"width": 1200,
"height": 630
},
"datePublished": "2026-05-08T14:30:00+03:00",
"dateModified": "2026-05-08T16:00:00+03:00",
"author": {
"@type": "Person",
"name": "Иван Иванов",
"url": "https://example.com/authors/ivan-ivanov/"
},
"publisher": {
"@type": "Organization",
"name": "Название издания",
"logo": {
"@type": "ImageObject",
"url": "https://example.com/logo.png",
"width": 600,
"height": 60
}
},
"mainEntityOfPage": {
"@type": "WebPage",
"@id": "https://example.com/news/article-slug/"
}
}
</script>
3.5 RSS и Atom фиды
RSS/Atom-фиды — дополнительный (и очень эффективный) способ уведомить Googlebot-News о новых публикациях. Указывайте их в <head> страниц:
<link rel="alternate" type="application/rss+xml"
title="Название издания — RSS"
href="https://example.com/feed.rss">
<link rel="alternate" type="application/atom+xml"
title="Название издания — Atom"
href="https://example.com/feed.atom">
Рекомендации для RSS/Atom:
- Публикуйте полный текст статьи в
<content:encoded>, а не только анонс - Включайте
<pubDate>в формате RFC 2822 - Не удаляйте старые записи из фида — только добавляйте новые наверх
- Максимум 50–100 последних материалов
4. Нагрузка на сервер
Googlebot-News создаёт нагрузку, принципиально отличающуюся от других краулеров: она приходит резкими пиками в момент активных новостных событий, а не равномерно.
4.1 Типичная нагрузка
| Тип издания | Публикаций в день | Характер нагрузки |
|---|---|---|
| Небольшой блог / нишевое СМИ | 1–10 | Незаметная, редкие визиты |
| Региональное СМИ | 10–50 | Умеренная, предсказуемая |
| Федеральное издание | 100–500 | Ощутимая, пики в часы активности |
| Крупный новостной портал | 500+ | Высокая, постоянная |
| Агрегатор / UGC-новости | Тысячи | Очень высокая, нужен crawl control |
4.2 Факторы, увеличивающие нагрузку
- Breaking news / резонансные события — Googlebot-News резко учащает обходы при росте интереса к теме
- Частые обновления статей — каждое изменение провоцирует повторный визит краулера
- Большой RSS-фид — Google парсит фид при каждом обходе
- Тяжёлые страницы статей — много JS, реклама, виджеты
- Отсутствие кеша — краулер каждый раз получает динамически сгенерированную страницу
- Редиректы в URL статей — тратят crawl budget впустую
4.3 Признаки проблем в логах
# Пики запросов от Googlebot-News
grep 'Googlebot-News' access.log | awk '{print $4}' | cut -d: -f2 | sort | uniq -c
# 5xx ошибки при обращении краулера
grep 'Googlebot-News' access.log | awk '$9 >= 500 {print $7, $9}' | sort | uniq -c | sort -nr
# Время ответа сервера (если логируется)
grep 'Googlebot-News' access.log | awk '{print $NF}' | sort -n | tail -20
5. Обнаружение в логах
5.1 Как выглядит запись
# Nginx access.log:
66.249.66.1 - - [08/May/2026:09:15:33 +0000] \
"GET /news/breaking-story-today/ HTTP/1.1" \
200 18432 "-" \
"Mozilla/5.0 (compatible; Googlebot-News; +http://www.google.com/bot.html)"
# Характерно: бот приходит на новые URL через минуты после публикации
5.2 Аналитика через grep
Найти все запросы Googlebot-News:
grep -i 'Googlebot-News' /var/log/nginx/access.log
Подсчитать количество запросов:
grep -i 'Googlebot-News' access.log | wc -l
Топ обходимых URL:
grep -i 'Googlebot-News' access.log \
| awk '{print $7}' | sort | uniq -c | sort -nr | head -30
Активность по часам (когда бот самый активный):
grep -i 'Googlebot-News' access.log \
| awk '{print $4}' | cut -d: -f2 | sort | uniq -c | sort -n
HTTP-коды ответов:
grep -i 'Googlebot-News' access.log \
| awk '{print $9}' | sort | uniq -c | sort -nr
Запросы к News Sitemap (как часто бот проверяет):
grep -i 'Googlebot-News' access.log | grep 'sitemap\|news-sitemap\|feed'
Live-мониторинг:
tail -f /var/log/nginx/access.log | grep --line-buffered 'Googlebot-News'
5.3 Верификация подлинности
#!/bin/bash
# Проверка: настоящий ли Googlebot-News?
IP=$1
HOST=$(host $IP | awk '{print $NF}')
if [[ $HOST == *googlebot.com* ]]; then
FWD=$(host $HOST | awk '{print $NF}')
[[ $FWD == $IP ]] && echo "✔ Настоящий Googlebot-News" || echo "✖ DNS mismatch"
else
echo "✖ Fake Googlebot-News (нет PTR записи googlebot.com)"
fi
6. SEO-оптимизация для Google News и Top Stories
6.1 Заголовок — главный фактор
Заголовок статьи — самый важный элемент для Google News. Правила:
- Точно отражает содержание (Google борется с кликбейтом)
- Длина — до 110 символов для полного отображения в Top Stories
- Содержит ключевые слова, по которым ищут новость
- Совпадает с
<title>страницы и полемheadlineв Schema.org - Не использует CAPS LOCK, чрезмерные знаки восклицания
<!-- ✖ Плохо: кликбейт -->
<h1>ВЫ НЕ ПОВЕРИТЕ что случилось сегодня!!!</h1>
<!-- ✖ Плохо: слишком расплывчато -->
<h1>Важные события недели</h1>
<!-- ✔ Хорошо: конкретно, информативно -->
<h1>ЦБ поднял ключевую ставку до 18%: что изменится для ипотеки</h1>
6.2 Дата публикации — обязательный элемент
Google News очень чувствителен к дате. Неправильная или отсутствующая дата — частая причина, почему статьи не попадают в Top Stories.
<!-- Машиночитаемая дата через тег time -->
<time datetime="2026-05-08T14:30:00+03:00">
8 мая 2026, 14:30
</time>
<!-- В Schema.org (обязательно совпадает с видимой датой) -->
"datePublished": "2026-05-08T14:30:00+03:00",
"dateModified": "2026-05-08T16:00:00+03:00"
⚠ Критические правила для дат:
- Дата на странице должна совпадать с датой в Schema.org и News Sitemap
- Не меняйте дату публикации после выхода материала (это нарушает доверие)
- Дату последнего обновления (
dateModified) можно и нужно обновлять при правках - Используйте ISO 8601 с часовым поясом
6.3 Авторство и E-E-A-T
Google всё больше внимания уделяет сигналам E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) для новостного контента:
- Страница автора с биографией, ссылками на соцсети и другие публикации
- Байлайн (имя автора) на каждой статье
- Ссылки на авторитетные источники в тексте
- Раздел «О редакции» с контактами
- Чёткая политика исправлений и обновлений
"author": [
{
"@type": "Person",
"name": "Иван Иванов",
"url": "https://example.com/authors/ivan-ivanov/",
"sameAs": [
"https://twitter.com/ivanov",
"https://www.linkedin.com/in/ivanov/"
]
}
]
6.4 Изображение для Top Stories
Изображение — обязательный элемент для попадания в карусель Top Stories:
- Минимальная ширина: 1200px
- Рекомендуемое соотношение сторон: 16:9
- Формат: JPEG или WebP
- Изображение должно быть релевантно содержанию статьи
- Не использовать логотипы и иконки как главное изображение
- Добавлять через Schema.org
imageиog:image
<!-- Open Graph -->
<meta property="og:image" content="https://example.com/images/article.jpg">
<meta property="og:image:width" content="1200">
<meta property="og:image:height" content="630">
<!-- Twitter Card -->
<meta name="twitter:card" content="summary_large_image">
<meta name="twitter:image" content="https://example.com/images/article.jpg">
6.5 Paywalled контент
Если сайт использует платный доступ, Google нужно правильно разметить статью, чтобы краулер мог прочитать контент и корректно отображать его:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "NewsArticle",
"headline": "Заголовок платной статьи",
"isAccessibleForFree": false,
"hasPart": {
"@type": "WebPageElement",
"isAccessibleForFree": false,
"cssSelector": ".paywall-content"
}
}
</script>
7. Управление Googlebot-News
7.1 robots.txt
ℹ robots.txt — это соглашение, а не техническая блокировка. Настоящий Googlebot-News его уважает. Для новостных сайтов полная блокировка означает полное выпадение из Google News.
Полная блокировка Googlebot-News (крайний случай):
User-agent: Googlebot-News
Disallow: /
Блокировка определённых разделов от индексации в Google News:
User-agent: Googlebot-News
Disallow: /opinion/
Disallow: /ads/
Disallow: /entertainment/
Disallow: /sponsored/
Disallow: /partners/
Разрешить основной Googlebot, заблокировать только Googlebot-News:
User-agent: Googlebot
Disallow:
User-agent: Googlebot-News
Disallow: /
User-agent: *
Disallow: /admin/
Рекомендуемый robots.txt для новостного сайта:
User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /*?sort=
Disallow: /*?page=
Disallow: /tag/
Disallow: /author/?
Allow: /
User-agent: Googlebot-News
Disallow: /sponsored/
Disallow: /promo/
Sitemap: https://example.com/sitemap.xml
Sitemap: https://example.com/news-sitemap.xml
7.2 Noindex для отдельных материалов
<!-- Запретить индексацию в Google News, не трогая основной поиск -->
<meta name="googlebot-news" content="noindex">
<!-- Запретить полностью -->
<meta name="robots" content="noindex">
<!-- HTTP-заголовок (Nginx) -->
add_header X-Robots-Tag "noindex" always;
7.3 Блокировка через .htaccess (Apache)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Googlebot-News [NC]
RewriteRule .* - [F,L]
7.4 Блокировка через Nginx
map $http_user_agent $is_gbot_news {
default 0;
"~*Googlebot-News" 1;
}
if ($is_gbot_news) {
return 403;
}
7.5 Исключение из Google News Publisher Center
Если сайт зарегистрирован в Google Publisher Center — это основной инструмент управления присутствием в Google News. Через Publisher Center можно:
- Указать разделы сайта для включения/исключения из Google News
- Настроить категории и геотаргетинг
- Управлять брендом издания
- Отслеживать статистику трафика из Google News
8. Как уменьшить нагрузку
Кеширование страниц статей
# Nginx — кеш для страниц статей (после публикации они редко меняются)
location ~* ^/news/ {
add_header Cache-Control "public, max-age=3600, stale-while-revalidate=86400";
}
# Для RSS/Atom фидов — короткий кеш (часто обновляются)
location ~* /feed\.(rss|atom|xml)$ {
add_header Cache-Control "public, max-age=300";
}
Оптимизация News Sitemap
- Генерируйте sitemap динамически при каждой публикации, не по расписанию
- Включайте только статьи за последние 48 часов
- Не включайте обновления старых статей, если не было значительных правок
- Пингуйте Google после обновления sitemap:
# Пинг Google после обновления News Sitemap
curl "https://www.google.com/ping?sitemap=https://example.com/news-sitemap.xml"
Ограничение скорости для ботов
# Nginx — rate limiting для ботов (не для настоящего Googlebot-News!)
# Применять только для поддельных ботов после DNS-верификации
limit_req_zone $binary_remote_addr zone=bots:10m rate=5r/s;
location / {
limit_req zone=bots burst=20 nodelay;
}
Предотвращение дублирования контента
<!-- Canonical для каждой статьи -->
<link rel="canonical" href="https://example.com/news/original-article-slug/">
<!-- Для AMP-версий -->
<link rel="amphtml" href="https://example.com/news/article-slug/amp/">
9. AMP и Google News
AMP (Accelerated Mobile Pages) раньше был обязательным требованием для попадания в Top Stories. Начиная с июня 2021 года Google отменил это требование — теперь для Top Stories достаточно хорошего Core Web Vitals.
| Аспект | До июня 2021 | После июня 2021 |
|---|---|---|
| Top Stories на мобильных | Требовался AMP | Любая страница с хорошим CWV |
| Значок молнии AMP в выдаче | Показывался | Убран |
| Скорость индексации | AMP быстрее | Равные условия |
| Использование AMP | Рекомендован | Опционально |
Core Web Vitals для Top Stories
| Метрика | Хорошо | Нужно улучшить | Плохо |
|---|---|---|---|
| LCP (загрузка главного контента) | < 2.5 сек | 2.5 — 4 сек | > 4 сек |
| INP (отклик на взаимодействие) | < 200 мс | 200 — 500 мс | > 500 мс |
| CLS (визуальная стабильность) | < 0.1 | 0.1 — 0.25 | > 0.25 |
10. Googlebot-News vs другие новостные краулеры
| Краулер | Платформа | User-Agent | Характер |
|---|---|---|---|
| Googlebot-News | Google News / Top Stories | Googlebot-News |
Вежливый, быстрый |
| Bingbot | Bing News | bingbot/2.0 |
Умеренный |
| Yahoo Slurp | Yahoo News | Yahoo! Slurp |
Умеренный |
| Yandex News Bot | Яндекс.Новости | YandexNews/1.0 |
Умеренный |
| Flipboard Proxy | FlipboardProxy |
Агрегатор RSS | |
| Feedly | Feedly RSS reader | Feedly |
RSS-агрегатор |
| GPTBot | OpenAI | GPTBot |
AI-харвестер, агрессивный |
| Bytespider | Bytedance/TikTok | Bytespider |
AI-скрапер, очень агрессивный |
Блокировка AI-харвестеров через robots.txt (если хотите защитить контент):
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: anthropic-ai
Disallow: /
11. Рекомендуемая стратегия
✔ Главный принцип: Google News — это не просто SEO, это доверие. Регулярность, точность, авторитетность и скорость публикации важнее любых технических трюков.
| Задача | Решение |
|---|---|
| Попасть в Google News | Регистрация в Google Publisher Center + соответствие требованиям |
| Ускорить индексацию новостей | News Sitemap + RSS-фид + пинг Google при публикации |
| Попасть в Top Stories | Schema.org NewsArticle + изображение 1200px + хороший CWV |
| Улучшить E-E-A-T | Страницы авторов + байлайны + ссылки на источники |
| Снизить нагрузку от бота | Кеш страниц + оптимизация HTML + CDN |
| Убрать раздел из Google News | robots.txt: User-agent: Googlebot-News / Disallow: /section/ |
| Убрать статью из Google News | <meta name="googlebot-news" content="noindex"> |
| Проверить активность бота | grep 'Googlebot-News' + мониторинг 4xx/5xx кодов |
| Верифицировать бота | Двухэтапный DNS lookup (reverse + forward на googlebot.com) |