TrafficVeil
Боты 12 мин25 июня 2026 г.

Googlebot-News

Googlebot-News — специализированный краулер Google, предназначенный исключительно для индексации новостного контента. Он обеспечивает работу сервисов Google News, Google Discover и блока «Главные новости» (Top Stories) в результатах поиска.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Googlebot-News
  2. 1.1 User-Agent строка
  3. 1.2 Место в экосистеме Google-ботов
  4. 1.3 Куда попадает контент
  5. 1.4 IP-адреса
  6. 2. Как работает Googlebot-News
  7. 2.1 Этапы обхода
  8. 2.2 Что Googlebot-News анализирует
  9. 2.3 Ключевое отличие: скорость
  10. 3. Технические требования для Google News
  11. 3.1 Требования к сайту
  12. 3.2 Требования к статьям
  13. 3.3 News Sitemap — обязательный инструмент
  14. 3.4 Schema.org NewsArticle
  15. 3.5 RSS и Atom фиды
  16. 4. Нагрузка на сервер
  17. 4.1 Типичная нагрузка
  18. 4.2 Факторы, увеличивающие нагрузку
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В отличие от основного Googlebot, который может индексировать страницу спустя дни или недели, Googlebot-News работает в режиме близком к реальному времени — новые материалы могут появиться в Google News в течение нескольких минут после публикации.

Понимание работы этого краулера критически важно для новостных изданий, блогов, медиапорталов и любых сайтов, которые хотят получать трафик из Google News и Top Stories.

1. Что такое Googlebot-News

1.1 User-Agent строка

Googlebot-News

# Полная строка:
Mozilla/5.0 (compatible; Googlebot-News; +http://www.google.com/bot.html)

1.2 Место в экосистеме Google-ботов

Краулер Зона ответственности Скорость индексации
Googlebot (Desktop/Mobile) Основной поиск, общая индексация Часы — недели
Googlebot-News Google News, Discover, Top Stories Минуты — часы
Googlebot-Image Google Images Часы — дни
Google-InspectionTool Ручная инспекция в Search Console По запросу

1.3 Куда попадает контент

Поверхность Описание Требования
Google News (news.google.com) Новостной агрегатор Одобрение в Google News
Top Stories (поисковая выдача) Карусель новостей в Google Search AMP или Web Stories рекомендуется
Google Discover Лента рекомендаций на Android/iOS Качественный контент, хорошие E-E-A-T сигналы
Google Search (основной) Обычная выдача Стандартная SEO-оптимизация

1.4 IP-адреса

Googlebot-News использует те же IP-диапазоны Google (AS15169), что и основной Googlebot. Актуальный список публикуется по адресу:

https://developers.google.com/search/apis/ipranges/googlebot.json

Около 90% запросов с User-Agent «Googlebot-News» в логах — поддельные боты. Единственный надёжный способ проверки — двухэтапная DNS-верификация (reverse + forward lookup на crawl-*.googlebot.com).

2. Как работает Googlebot-News

2.1 Этапы обхода

  1. Google News crawler непрерывно мониторит RSS/Atom-фиды и News Sitemap зарегистрированных изданий.
  2. При обнаружении новой записи URL добавляется в приоритетную очередь.
  3. Googlebot-News скачивает страницу в течение нескольких минут после публикации.
  4. Анализируется контент: заголовок, дата публикации, автор, тело статьи.
  5. Проверяются сигналы качества: уникальность, авторитетность, E-E-A-T.
  6. Статья добавляется в индекс Google News и может появиться в Top Stories.

2.2 Что Googlebot-News анализирует

Элемент Что извлекается Важность
Заголовок статьи (<h1>, <title>) Основная тема материала ⭐⭐⭐⭐⭐ Критически важно
Дата публикации Свежесть контента ⭐⭐⭐⭐⭐ Критически важно
Автор материала E-E-A-T сигналы авторства ⭐⭐⭐⭐ Очень важно
Тело статьи Уникальность, глубина, релевантность ⭐⭐⭐⭐⭐ Критически важно
News Sitemap Метаданные новости ⭐⭐⭐⭐ Очень важно
Schema.org NewsArticle Структурированные данные ⭐⭐⭐⭐ Очень важно
Canonical URL Оригинальный источник ⭐⭐⭐⭐ Очень важно
Язык материала (hreflang) Геотаргетинг новости ⭐⭐⭐ Важно
Изображение статьи Превью в Top Stories / Discover ⭐⭐⭐⭐ Очень важно
Paywalled контент Наличие paywall-разметки ⭐⭐⭐ Важно

2.3 Ключевое отличие: скорость

Googlebot-News работает принципиально иначе, чем основной Googlebot:

  • Основной Googlebot — обходит сайт по расписанию, приоритет определяется PageRank и crawl budget. Новая страница может ждать индексации дни и недели.
  • Googlebot-News — реагирует на публикацию почти в реальном времени. Новость может появиться в Google News через 2–5 минут после выхода.

Это делает News Sitemap и RSS-фиды критически важными инструментами для новостных изданий.

3. Технические требования для Google News

3.1 Требования к сайту

Требование Детали
Регистрация в Google News Через Google Publisher Center (publishercenter.google.com)
Уникальный оригинальный контент Без агрегации чужих материалов без добавленной ценности
Чёткая структура сайта Отдельные URL для каждой статьи, понятная навигация
Дата и автор на странице Машиночитаемая дата (schema.org или <time>)
Страница «О редакции» Информация об авторах, контактные данные, политика редакции
Политика конфиденциальности Обязательна
HTTPS Обязателен

3.2 Требования к статьям

  • Уникальный URL для каждой статьи, не изменяющийся после публикации
  • Заголовок — не кликбейт, соответствует содержанию
  • Дата публикации и дата последнего обновления
  • Имя автора (или редакции) на странице
  • Минимум один абзац оригинального текста
  • Изображение не менее 1200px по ширине для Top Stories
  • Контент не должен нарушать Google News Content Policies

3.3 News Sitemap — обязательный инструмент

News Sitemap — расширение стандартного sitemap.xml, специально предназначенное для новостных сайтов. Это главный сигнал для Googlebot-News о новых публикациях.

Ключевые правила News Sitemap:

  • Включать только статьи, опубликованные за последние 2 дня (48 часов)
  • Максимум 1 000 URL в одном файле
  • Обновлять при каждой новой публикации
  • Указывать в robots.txt или Google Search Console
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"
        xmlns:news="http://www.google.com/schemas/sitemap-news/0.9">
  <url>
    <loc>https://example.com/news/article-slug/</loc>
    <news:news>
      <news:publication>
        <news:name>Название издания</news:name>
        <news:language>ru</news:language>
      </news:publication>
      <news:publication_date>2026-05-08T14:30:00+03:00</news:publication_date>
      <news:title>Заголовок новости точно как в статье</news:title>
      <news:keywords>ключевое слово, тема, категория</news:keywords>
    </news:news>
  </url>
</urlset>

Регистрация sitemap в robots.txt:

Sitemap: https://example.com/news-sitemap.xml

3.4 Schema.org NewsArticle

Структурированные данные — обязательный элемент для попадания в Top Stories и Google Discover с расширенным сниппетом:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "NewsArticle",
  "headline": "Заголовок статьи (до 110 символов)",
  "description": "Краткое описание материала для превью",
  "image": {
    "@type": "ImageObject",
    "url": "https://example.com/images/article-cover.jpg",
    "width": 1200,
    "height": 630
  },
  "datePublished": "2026-05-08T14:30:00+03:00",
  "dateModified": "2026-05-08T16:00:00+03:00",
  "author": {
    "@type": "Person",
    "name": "Иван Иванов",
    "url": "https://example.com/authors/ivan-ivanov/"
  },
  "publisher": {
    "@type": "Organization",
    "name": "Название издания",
    "logo": {
      "@type": "ImageObject",
      "url": "https://example.com/logo.png",
      "width": 600,
      "height": 60
    }
  },
  "mainEntityOfPage": {
    "@type": "WebPage",
    "@id": "https://example.com/news/article-slug/"
  }
}
</script>

3.5 RSS и Atom фиды

RSS/Atom-фиды — дополнительный (и очень эффективный) способ уведомить Googlebot-News о новых публикациях. Указывайте их в <head> страниц:

<link rel="alternate" type="application/rss+xml"
      title="Название издания — RSS"
      href="https://example.com/feed.rss">

<link rel="alternate" type="application/atom+xml"
      title="Название издания — Atom"
      href="https://example.com/feed.atom">

Рекомендации для RSS/Atom:

  • Публикуйте полный текст статьи в <content:encoded>, а не только анонс
  • Включайте <pubDate> в формате RFC 2822
  • Не удаляйте старые записи из фида — только добавляйте новые наверх
  • Максимум 50–100 последних материалов

4. Нагрузка на сервер

Googlebot-News создаёт нагрузку, принципиально отличающуюся от других краулеров: она приходит резкими пиками в момент активных новостных событий, а не равномерно.

4.1 Типичная нагрузка

Тип издания Публикаций в день Характер нагрузки
Небольшой блог / нишевое СМИ 1–10 Незаметная, редкие визиты
Региональное СМИ 10–50 Умеренная, предсказуемая
Федеральное издание 100–500 Ощутимая, пики в часы активности
Крупный новостной портал 500+ Высокая, постоянная
Агрегатор / UGC-новости Тысячи Очень высокая, нужен crawl control

4.2 Факторы, увеличивающие нагрузку

  • Breaking news / резонансные событияGooglebot-News резко учащает обходы при росте интереса к теме
  • Частые обновления статей — каждое изменение провоцирует повторный визит краулера
  • Большой RSS-фид — Google парсит фид при каждом обходе
  • Тяжёлые страницы статей — много JS, реклама, виджеты
  • Отсутствие кеша — краулер каждый раз получает динамически сгенерированную страницу
  • Редиректы в URL статей — тратят crawl budget впустую

4.3 Признаки проблем в логах

# Пики запросов от Googlebot-News
grep 'Googlebot-News' access.log | awk '{print $4}' | cut -d: -f2 | sort | uniq -c

# 5xx ошибки при обращении краулера
grep 'Googlebot-News' access.log | awk '$9 >= 500 {print $7, $9}' | sort | uniq -c | sort -nr

# Время ответа сервера (если логируется)
grep 'Googlebot-News' access.log | awk '{print $NF}' | sort -n | tail -20

5. Обнаружение в логах

5.1 Как выглядит запись

# Nginx access.log:
66.249.66.1 - - [08/May/2026:09:15:33 +0000] \
  "GET /news/breaking-story-today/ HTTP/1.1" \
  200 18432 "-" \
  "Mozilla/5.0 (compatible; Googlebot-News; +http://www.google.com/bot.html)"

# Характерно: бот приходит на новые URL через минуты после публикации

5.2 Аналитика через grep

Найти все запросы Googlebot-News:

grep -i 'Googlebot-News' /var/log/nginx/access.log

Подсчитать количество запросов:

grep -i 'Googlebot-News' access.log | wc -l

Топ обходимых URL:

grep -i 'Googlebot-News' access.log \
  | awk '{print $7}' | sort | uniq -c | sort -nr | head -30

Активность по часам (когда бот самый активный):

grep -i 'Googlebot-News' access.log \
  | awk '{print $4}' | cut -d: -f2 | sort | uniq -c | sort -n

HTTP-коды ответов:

grep -i 'Googlebot-News' access.log \
  | awk '{print $9}' | sort | uniq -c | sort -nr

Запросы к News Sitemap (как часто бот проверяет):

grep -i 'Googlebot-News' access.log | grep 'sitemap\|news-sitemap\|feed'

Live-мониторинг:

tail -f /var/log/nginx/access.log | grep --line-buffered 'Googlebot-News'

5.3 Верификация подлинности

#!/bin/bash
# Проверка: настоящий ли Googlebot-News?
IP=$1
HOST=$(host $IP | awk '{print $NF}')
if [[ $HOST == *googlebot.com* ]]; then
  FWD=$(host $HOST | awk '{print $NF}')
  [[ $FWD == $IP ]] && echo "✔ Настоящий Googlebot-News" || echo "✖ DNS mismatch"
else
  echo "✖ Fake Googlebot-News (нет PTR записи googlebot.com)"
fi

6. SEO-оптимизация для Google News и Top Stories

6.1 Заголовок — главный фактор

Заголовок статьи — самый важный элемент для Google News. Правила:

  • Точно отражает содержание (Google борется с кликбейтом)
  • Длина — до 110 символов для полного отображения в Top Stories
  • Содержит ключевые слова, по которым ищут новость
  • Совпадает с <title> страницы и полем headline в Schema.org
  • Не использует CAPS LOCK, чрезмерные знаки восклицания
<!-- ✖ Плохо: кликбейт -->
<h1>ВЫ НЕ ПОВЕРИТЕ что случилось сегодня!!!</h1>

<!-- ✖ Плохо: слишком расплывчато -->
<h1>Важные события недели</h1>

<!-- ✔ Хорошо: конкретно, информативно -->
<h1>ЦБ поднял ключевую ставку до 18%: что изменится для ипотеки</h1>

6.2 Дата публикации — обязательный элемент

Google News очень чувствителен к дате. Неправильная или отсутствующая дата — частая причина, почему статьи не попадают в Top Stories.

<!-- Машиночитаемая дата через тег time -->
<time datetime="2026-05-08T14:30:00+03:00">
  8 мая 2026, 14:30
</time>

<!-- В Schema.org (обязательно совпадает с видимой датой) -->
"datePublished": "2026-05-08T14:30:00+03:00",
"dateModified": "2026-05-08T16:00:00+03:00"

⚠ Критические правила для дат:

  • Дата на странице должна совпадать с датой в Schema.org и News Sitemap
  • Не меняйте дату публикации после выхода материала (это нарушает доверие)
  • Дату последнего обновления (dateModified) можно и нужно обновлять при правках
  • Используйте ISO 8601 с часовым поясом

6.3 Авторство и E-E-A-T

Google всё больше внимания уделяет сигналам E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) для новостного контента:

  • Страница автора с биографией, ссылками на соцсети и другие публикации
  • Байлайн (имя автора) на каждой статье
  • Ссылки на авторитетные источники в тексте
  • Раздел «О редакции» с контактами
  • Чёткая политика исправлений и обновлений
"author": [
  {
    "@type": "Person",
    "name": "Иван Иванов",
    "url": "https://example.com/authors/ivan-ivanov/",
    "sameAs": [
      "https://twitter.com/ivanov",
      "https://www.linkedin.com/in/ivanov/"
    ]
  }
]

6.4 Изображение для Top Stories

Изображение — обязательный элемент для попадания в карусель Top Stories:

  • Минимальная ширина: 1200px
  • Рекомендуемое соотношение сторон: 16:9
  • Формат: JPEG или WebP
  • Изображение должно быть релевантно содержанию статьи
  • Не использовать логотипы и иконки как главное изображение
  • Добавлять через Schema.org image и og:image
<!-- Open Graph -->
<meta property="og:image" content="https://example.com/images/article.jpg">
<meta property="og:image:width" content="1200">
<meta property="og:image:height" content="630">

<!-- Twitter Card -->
<meta name="twitter:card" content="summary_large_image">
<meta name="twitter:image" content="https://example.com/images/article.jpg">

6.5 Paywalled контент

Если сайт использует платный доступ, Google нужно правильно разметить статью, чтобы краулер мог прочитать контент и корректно отображать его:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "NewsArticle",
  "headline": "Заголовок платной статьи",
  "isAccessibleForFree": false,
  "hasPart": {
    "@type": "WebPageElement",
    "isAccessibleForFree": false,
    "cssSelector": ".paywall-content"
  }
}
</script>

7. Управление Googlebot-News

7.1 robots.txt

robots.txt — это соглашение, а не техническая блокировка. Настоящий Googlebot-News его уважает. Для новостных сайтов полная блокировка означает полное выпадение из Google News.

Полная блокировка Googlebot-News (крайний случай):

User-agent: Googlebot-News
Disallow: /

Блокировка определённых разделов от индексации в Google News:

User-agent: Googlebot-News
Disallow: /opinion/
Disallow: /ads/
Disallow: /entertainment/
Disallow: /sponsored/
Disallow: /partners/

Разрешить основной Googlebot, заблокировать только Googlebot-News:

User-agent: Googlebot
Disallow:

User-agent: Googlebot-News
Disallow: /

User-agent: *
Disallow: /admin/

Рекомендуемый robots.txt для новостного сайта:

User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /*?sort=
Disallow: /*?page=
Disallow: /tag/
Disallow: /author/?
Allow: /

User-agent: Googlebot-News
Disallow: /sponsored/
Disallow: /promo/

Sitemap: https://example.com/sitemap.xml
Sitemap: https://example.com/news-sitemap.xml

7.2 Noindex для отдельных материалов

<!-- Запретить индексацию в Google News, не трогая основной поиск -->
<meta name="googlebot-news" content="noindex">

<!-- Запретить полностью -->
<meta name="robots" content="noindex">

<!-- HTTP-заголовок (Nginx) -->
add_header X-Robots-Tag "noindex" always;

7.3 Блокировка через .htaccess (Apache)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Googlebot-News [NC]
RewriteRule .* - [F,L]

7.4 Блокировка через Nginx

map $http_user_agent $is_gbot_news {
    default          0;
    "~*Googlebot-News" 1;
}

if ($is_gbot_news) {
    return 403;
}

7.5 Исключение из Google News Publisher Center

Если сайт зарегистрирован в Google Publisher Center — это основной инструмент управления присутствием в Google News. Через Publisher Center можно:

  • Указать разделы сайта для включения/исключения из Google News
  • Настроить категории и геотаргетинг
  • Управлять брендом издания
  • Отслеживать статистику трафика из Google News

8. Как уменьшить нагрузку

Кеширование страниц статей

# Nginx — кеш для страниц статей (после публикации они редко меняются)
location ~* ^/news/ {
    add_header Cache-Control "public, max-age=3600, stale-while-revalidate=86400";
}

# Для RSS/Atom фидов — короткий кеш (часто обновляются)
location ~* /feed\.(rss|atom|xml)$ {
    add_header Cache-Control "public, max-age=300";
}

Оптимизация News Sitemap

  • Генерируйте sitemap динамически при каждой публикации, не по расписанию
  • Включайте только статьи за последние 48 часов
  • Не включайте обновления старых статей, если не было значительных правок
  • Пингуйте Google после обновления sitemap:
# Пинг Google после обновления News Sitemap
curl "https://www.google.com/ping?sitemap=https://example.com/news-sitemap.xml"

Ограничение скорости для ботов

# Nginx — rate limiting для ботов (не для настоящего Googlebot-News!)
# Применять только для поддельных ботов после DNS-верификации
limit_req_zone $binary_remote_addr zone=bots:10m rate=5r/s;

location / {
    limit_req zone=bots burst=20 nodelay;
}

Предотвращение дублирования контента

<!-- Canonical для каждой статьи -->
<link rel="canonical" href="https://example.com/news/original-article-slug/">

<!-- Для AMP-версий -->
<link rel="amphtml" href="https://example.com/news/article-slug/amp/">

9. AMP и Google News

AMP (Accelerated Mobile Pages) раньше был обязательным требованием для попадания в Top Stories. Начиная с июня 2021 года Google отменил это требование — теперь для Top Stories достаточно хорошего Core Web Vitals.

Аспект До июня 2021 После июня 2021
Top Stories на мобильных Требовался AMP Любая страница с хорошим CWV
Значок молнии AMP в выдаче Показывался Убран
Скорость индексации AMP быстрее Равные условия
Использование AMP Рекомендован Опционально

Core Web Vitals для Top Stories

Метрика Хорошо Нужно улучшить Плохо
LCP (загрузка главного контента) < 2.5 сек 2.5 — 4 сек > 4 сек
INP (отклик на взаимодействие) < 200 мс 200 — 500 мс > 500 мс
CLS (визуальная стабильность) < 0.1 0.1 — 0.25 > 0.25

10. Googlebot-News vs другие новостные краулеры

Краулер Платформа User-Agent Характер
Googlebot-News Google News / Top Stories Googlebot-News Вежливый, быстрый
Bingbot Bing News bingbot/2.0 Умеренный
Yahoo Slurp Yahoo News Yahoo! Slurp Умеренный
Yandex News Bot Яндекс.Новости YandexNews/1.0 Умеренный
Flipboard Proxy Flipboard FlipboardProxy Агрегатор RSS
Feedly Feedly RSS reader Feedly RSS-агрегатор
GPTBot OpenAI GPTBot AI-харвестер, агрессивный
Bytespider Bytedance/TikTok Bytespider AI-скрапер, очень агрессивный

Блокировка AI-харвестеров через robots.txt (если хотите защитить контент):

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: anthropic-ai
Disallow: /

11. Рекомендуемая стратегия

✔ Главный принцип: Google News — это не просто SEO, это доверие. Регулярность, точность, авторитетность и скорость публикации важнее любых технических трюков.

Задача Решение
Попасть в Google News Регистрация в Google Publisher Center + соответствие требованиям
Ускорить индексацию новостей News Sitemap + RSS-фид + пинг Google при публикации
Попасть в Top Stories Schema.org NewsArticle + изображение 1200px + хороший CWV
Улучшить E-E-A-T Страницы авторов + байлайны + ссылки на источники
Снизить нагрузку от бота Кеш страниц + оптимизация HTML + CDN
Убрать раздел из Google News robots.txt: User-agent: Googlebot-News / Disallow: /section/
Убрать статью из Google News <meta name="googlebot-news" content="noindex">
Проверить активность бота grep 'Googlebot-News' + мониторинг 4xx/5xx кодов
Верифицировать бота Двухэтапный DNS lookup (reverse + forward на googlebot.com)

 

Другие гайды по ботам

Частые вопросы

Чем Googlebot-News отличается от основного Googlebot?

Googlebot-News специализируется исключительно на новостном контенте и работает в режиме близком к реальному времени — новая статья может появиться в Google News через 2–5 минут после публикации. Основной Googlebot обходит сайты по расписанию, а новая страница может ждать индексации дни и недели. Googlebot-News также ориентируется на News Sitemap, RSS-фиды и Schema.org NewsArticle, а не только на ссылки.

Нужно ли регистрироваться в Google News?

Для попадания в Google News (news.google.com) — да, необходима регистрация и одобрение через Google Publisher Center (publishercenter.google.com). Для попадания в блок Top Stories в основном поиске регистрация в Google News не обязательна, но нужны Schema.org NewsArticle и соответствие Content Policies. Трафик из Top Stories зачастую значительно больше, чем из самого Google News.

Почему мои статьи не попадают в Top Stories?

Основные причины: отсутствие или некорректная разметка Schema.org NewsArticle; изображение статьи меньше 1200px или отсутствует; плохие Core Web Vitals (LCP > 2.5 сек); кликбейтный заголовок; нет чёткой даты публикации; контент воспринимается как дубль или агрегация; у издания низкие E-E-A-T сигналы.

Что такое News Sitemap и как часто его обновлять?

News Sitemap — расширение стандартного sitemap.xml с дополнительными полями для новостей (дата публикации, название издания, ключевые слова). Его нужно обновлять при каждой новой публикации и включать только статьи за последние 48 часов. Для автоматического уведомления Google пингуйте: https://www.google.com/ping?sitemap=URL_вашего_sitemap.

Нужен ли AMP для попадания в Top Stories?

Нет. С июня 2021 года AMP перестал быть обязательным требованием для Top Stories. Теперь достаточно хорошего Core Web Vitals (LCP < 2.5 сек, INP < 200 мс, CLS < 0.1) и корректной разметки Schema.org NewsArticle. AMP по-прежнему является рабочим решением и поддерживается, но перестал быть конкурентным преимуществом.

Как заблокировать только Googlebot-News, оставив основной поиск?

Через robots.txt: добавьте User-agent: Googlebot-News и Disallow: /. Основной Googlebot продолжит индексировать сайт. Для исключения отдельных статей используйте мета-тег <meta name="googlebot-news" content="noindex"> — это запрещает только Googlebot-News при этом сохраняя индексацию основным Googlebot.

Как часто Googlebot-News обходит сайт?

Зависит от авторитета издания и частоты публикаций. Новостные сайты с активным обновлением обходятся практически непрерывно. Для небольших изданий — несколько раз в час при активных публикациях, несколько раз в день в остальное время. Googlebot-News также регулярно проверяет News Sitemap и RSS-фид на наличие новых материалов.

Что такое E-E-A-T и почему это важно для Google News?

E-E-A-T — Experience (опыт), Expertise (экспертиза), Authoritativeness (авторитетность), Trustworthiness (доверие). Для новостного контента Google особо строг к этим сигналам: кто автор, каков его опыт, насколько издание авторитетно в своей теме, есть ли контактные данные и политика исправлений. Низкие E-E-A-T сигналы — одна из главных причин отказа в подключении к Google News.

Можно ли использовать Googlebot-News для монетизации через paywall?

Да. Google поддерживает paywall-модели и предоставляет специальную разметку через Schema.org (isAccessibleForFree: false). Краулер получает доступ к полному тексту через flexible sampling, при этом пользователи в Google News видят анонс и попадают на платную страницу. Это называется «гибкая выборка» и полностью соответствует политике Google.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

GPTBot

GPTBot — краулер OpenAI, который собирает публично доступный веб-контент для обучения будущих поколений генеративных моделей семейства GPT. Это один из первых официально задокументированных ИИ-краулеров на рынке (представлен в августе 2023 года) и на сегодня — самый узнаваемый бот OpenAI среди веб-мастеров.

4 мин

OAI-AdsBot

OAI-AdsBot — самый новый краулер OpenAI, впервые появившийся в официальной документации в апреле 2026 года. Он обслуживает рекламную инфраструктуру ChatGPT: когда рекламодатель размещает объявление в ChatGPT Ads, этот бот посещает указанную посадочную страницу, чтобы проверить её на соответствие рекламным политикам OpenAI и, при необходимости, использовать содержимое страницы для оценки релевантности показа объявления.

3 мин

Keys.so Bot (keys-so-bot)

Keys-so-bot — краулер российского SEO-сервиса Keys.so (оператор — компания «Битерика Групп»), который используется для сбора данных о видимости сайтов в органической и контекстной выдаче Яндекса и Google, анализа семантического ядра конкурентов и построения истории изменений файлов robots.txt. Это не поисковый робот в классическом смысле — он не индексирует страницы для показа в результатах поиска, а сканирует сайты в интересах пользователей сервиса, которые анализируют конкурентов.

3 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.