TrafficVeil
Боты 6 мин23 июня 2026 г.

YandexBot детальное руководство

YandexBot — основной веб-краулер поисковой системы Яндекс. Он систематически обходит страницы интернета, скачивает их содержимое и формирует поисковый индекс Яндекса — крупнейшего поисковика на русскоязычном рынке. По аналогии с Googlebot для Google, YandexBot является фундаментом поиска Яндекса: без него ни один сайт не появится в результатах поиска ya.ru и yandex.com.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое YandexBot
  2. 1.1 User-Agent строки
  3. 1.2 Экосистема Яндекс-ботов
  4. 1.3 Рыночная позиция Яндекса
  5. 1.4 IP-адреса и верификация
  6. 2. Как работает YandexBot
  7. 2.1 Этапы обхода
  8. 2.2 Что YandexBot анализирует
  9. 2.3 Уникальные особенности Яндекса vs Google
  10. 3. Уникальные директивы robots.txt Яндекса
  11. 3.1 Стандартный robots.txt для Яндекса
  12. 3.2 Директива Crawl-delay — только для Яндекса
  13. 3.3 Директива Clean-param — уникальная для Яндекса
  14. 3.4 Директива Host — указание основного зеркала
  15. 3.5 Группировка Яндекс-ботов в robots.txt
  16. 4. Нагрузка на сервер
  17. 4.1 Типичная нагрузка по типам сайтов
  18. 4.2 Факторы, увеличивающие нагрузку
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Для сайтов с русскоязычной аудиторией, а также для ресурсов, нацеленных на рынки России, Беларуси, Казахстана, Узбекистана и других стран СНГ, правильная работа с YandexBot так же критически важна, как работа с Googlebot. В России Яндекс удерживает около 60–65% рынка поиска.

1. Что такое YandexBot

1.1 User-Agent строки

# Основной YandexBot (Desktop):
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)

# Полная строка с версией Chrome-движка:
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)
AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z

# Мобильный вариант:
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P)
AppleWebKit/537.36 (KHTML, like Gecko)
Chrome/41.0.2272.96 Mobile Safari/537.36
(compatible; YandexBot/3.0; +http://yandex.com/bots)

# Вариант с MirrorDetector (проверка зеркал сайта):
Mozilla/5.0 (compatible; YandexBot/3.0; MirrorDetector;
+http://yandex.com/bots)

Важно: версия Chrome в строке User-Agent периодически обновляется. Рекомендуется при поиске в логах не привязываться к конкретной версии, а искать по ключевому слову YandexBot.

1.2 Экосистема Яндекс-ботов

YandexBot — это не один бот, а целая экосистема специализированных краулеров. Все они используют общий токен Yandex в robots.txt для групповых правил:

User-Agent Назначение Влияет на выдачу?
YandexBot Основной краулер — индексация HTML-страниц ✔ Да, основная выдача
YandexImages Индексация изображений для Яндекс.Картинки ✔ Да, поиск по картинкам
YandexVideo Индексация видео для Яндекс.Видео ✔ Да, поиск видео
YandexNews Обход новостных ресурсов для Яндекс.Новостей ✔ Да, Яндекс.Новости
YandexMarket Краулер Яндекс.Маркета ✔ Да, Яндекс.Маркет
YandexDirect Проверка страниц для Яндекс.Директ Влияет на рекламу
YandexMedia Медиаконтент (аудио, подкасты) ✔ Да, медиапоиск
YandexFavicons Получение иконок сайтов для отображения в поиске Визуальное оформление
YandexWebmaster Технические проверки для Яндекс.Вебмастер ✖ Нет
YandexMetrika Сбор данных для Яндекс.Метрики ✖ Нет
YandexAccessibilityBot Проверка доступности сайтов (accessibility) ✖ Нет
YandexSitelinksBot Сбор данных для sitelinks в выдаче Косвенно
YandexVertisBot Вертикальный поиск (недвижимость, авто, работа) ✔ Вертикальный поиск
YandexScreenshotBot Скриншоты страниц для превью Визуальное оформление

1.3 Рыночная позиция Яндекса

Рынок Доля Яндекса Доля Google
Россия ~60–65% ~35–38%
Беларусь ~40–45% ~50–55%
Казахстан ~40% ~55%
Узбекистан ~25–30% ~65%
Турция ~2–3% ~93%

1.4 IP-адреса и верификация

# Официальные IP-диапазоны Яндекса:
https://yandex.com/ips

# YandexBot резолвится в домены:
*.yandex.ru
*.yandex.com
*.yandex.net

# Проверка подлинности — двухэтапный DNS lookup:
# Шаг 1: reverse DNS
host 77.88.55.60
# Должен вернуть что-то вроде: robot.yandex.ru или crawl.yandex.com

# Шаг 2: forward DNS
host robot.yandex.ru
# Должен вернуть исходный IP: 77.88.55.60

2. Как работает YandexBot

2.1 Этапы обхода

  1. Яндекс формирует очередь URL из sitemap.xml, внутренних ссылок, обратных ссылок и предыдущих обходов.
  2. YandexBot скачивает страницу, имитируя современный браузер (Chromium-движок).
  3. Скачиваются зависимые ресурсы: CSS, JS, изображения — для рендеринга.
  4. Выполняется JavaScript-рендеринг (Яндекс поддерживает JS с 2018 года).
  5. Анализируется контент: текст, заголовки, метаданные, структурированные данные.
  6. URL-ы, найденные на странице, добавляются в очередь обхода.
  7. Страница попадает в индекс Яндекса и участвует в ранжировании.

2.2 Что YandexBot анализирует

Элемент Что извлекается Важность для SEO в Яндексе
Заголовок страницы (<title>) Основная тема, ключевые слова ⭐⭐⭐⭐⭐ Критически важно
H1 и подзаголовки Структура и тематика контента ⭐⭐⭐⭐⭐ Критически важно
Текстовый контент Семантика, ключевые слова, LSI ⭐⭐⭐⭐⭐ Критически важно
Мета-описание Сниппет в выдаче Яндекса ⭐⭐⭐⭐ Очень важно
Canonical URL Основная страница из дублей ⭐⭐⭐⭐ Очень важно
Schema.org разметка Расширенные сниппеты (рейтинги, цены, хлебные крошки) ⭐⭐⭐⭐ Очень важно
Open Graph / мета-теги Данные для отображения в соцсетях ⭐⭐⭐ Важно
Alt-тексты изображений Контекст для YandexImages ⭐⭐⭐⭐ Очень важно
Внутренние ссылки Архитектура сайта, вес страниц ⭐⭐⭐⭐ Очень важно
JavaScript-контент Полностью рендерится с 2018 года ⭐⭐⭐⭐ Очень важно
Язык и регион страницы Геотаргетинг в региональном поиске Яндекса ⭐⭐⭐⭐⭐ Критически для РФ

2.3 Уникальные особенности Яндекса vs Google

Аспект YandexBot / Яндекс Googlebot / Google
Региональная привязка Сильный геотаргетинг по регионам РФ Менее детальная региональность для РФ
Поведенческие факторы Учитывает данные Яндекс.Метрики (кликабельность, время на сайте) Поведенческие факторы не подтверждены официально
Коммерческий трафик Учитывает «коммерческость запроса» Аналог — Page Experience signals
Поддержка Crawl-delay ✔ Да, уважает директиву в robots.txt ✖ Нет, игнорирует
Clean-param в robots.txt ✔ Да, уникальная директива Яндекса ✖ Не поддерживается
JS-рендеринг ✔ Да (с 2018 года) ✔ Да (с 2015 года, WRS)
Инструмент вебмастера Яндекс.Вебмастер (webmaster.yandex.ru) Google Search Console

3. Уникальные директивы robots.txt Яндекса

Яндекс поддерживает все стандартные директивы robots.txt, плюс несколько собственных расширений, которых не поддерживают Google и другие поисковики.

3.1 Стандартный robots.txt для Яндекса

User-agent: YandexBot
Crawl-delay: 2
Disallow: /search/
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /private/
Disallow: /*?sort=
Disallow: /*?filter=
Allow: /

User-agent: YandexImages
Disallow: /private/
Allow: /

User-agent: *
Disallow: /admin/

Sitemap: https://example.com/sitemap.xml

3.2 Директива Crawl-delay — только для Яндекса

В отличие от Google, YandexBot уважает директиву Crawl-delay. Это важный инструмент управления нагрузкой:

# Пауза 2 секунды между запросами:
User-agent: YandexBot
Crawl-delay: 2

# Пауза 10 секунд (для нагруженных серверов):
User-agent: YandexBot
Crawl-delay: 10

# Применить ко всем Яндекс-ботам:
User-agent: Yandex
Crawl-delay: 5

# ВАЖНО: Crawl-delay не является частью официального стандарта robots.txt.
# Google игнорирует эту директиву. Яндекс её уважает.
# Для управления скоростью Googlebot используйте Google Search Console.

3.3 Директива Clean-param — уникальная для Яндекса

Директива Clean-param указывает Яндексу, какие URL-параметры являются техническими и не влияют на контент страницы. Это предотвращает дублирование контента из-за параметрических URL:

# Синтаксис:
# Clean-param: параметр [пробел] /путь (или * для всего сайта)

# Игнорировать UTM-параметры:
Clean-param: utm_source&utm_medium&utm_campaign&utm_content&utm_term

# Игнорировать сессионные параметры:
Clean-param: sid&session_id&ref&from

# Игнорировать параметры сортировки:
Clean-param: sort&order&direction /catalog/

# Комбинированный пример:
Clean-param: utm_source&utm_medium&utm_campaign
Clean-param: sid&session_id
Clean-param: sort&order /catalog/
Clean-param: page /archive/

# ВАЖНО: Google не поддерживает Clean-param.
# Для Google используйте canonical теги или параметры в Search Console.

3.4 Директива Host — указание основного зеркала

Яндекс поддерживает директиву Host для указания основного зеркала сайта (альтернатива canonical для главного домена):

# Указать главное зеркало для Яндекса:
Host: https://www.example.com

# Если сайт работает на HTTP и HTTPS — указать предпочтительный:
Host: https://example.com

# Если есть поддомены — указать основной:
Host: https://example.com

# Эта директива специфична для Яндекса, Google её игнорирует.

3.5 Группировка Яндекс-ботов в robots.txt

# Правило для ВСЕХ Яндекс-ботов:
User-agent: Yandex
Disallow: /private/
Crawl-delay: 3

# Правило только для основного YandexBot:
User-agent: YandexBot
Disallow: /*?sid=

# Правило для YandexImages отдельно:
User-agent: YandexImages
Disallow: /watermarked/

# Стандартное правило (* НЕ применяется к Яндекс-ботам):
User-agent: *
Disallow: /admin/
# Яндекс-боты этому правилу не подчиняются,
# если для них указаны явные директивы User-agent: Yandex

4. Нагрузка на сервер

YandexBot создаёт нагрузку, сопоставимую с Googlebot. Специфика в том, что для русскоязычных сайтов он может быть даже более активным, чем Googlebot, — особенно для новостных ресурсов и e-commerce.

4.1 Типичная нагрузка по типам сайтов

Тип сайта Нагрузка от YandexBot Частота
Небольшой сайт (до 1 000 стр.) Незаметная Несколько раз в неделю
Средний информационный сайт Низкая — умеренная Несколько раз в день
Новостной портал Высокая, пиковая при выходе новостей Ежечасно и чаще
Крупный интернет-магазин Ощутимая (тысячи страниц) Ежедневно
Форум / UGC-платформа Высокая (миллионы страниц) Постоянно, нужен контроль

4.2 Факторы, увеличивающие нагрузку

  • Параметрические URL без Clean-param — Яндекс обходит каждую комбинацию параметров как отдельную страницу
  • Бесконечная пагинация — /page/1/, /page/2/, ..., /page/999/ без управления
  • Дублированный контент — несколько URL с одинаковым контентом без canonical
  • Отсутствие Crawl-delay — бот работает с максимальной скоростью
  • Тяжёлые JS-страницы — рендеринг требует больше ресурсов
  • Большой сайт без сегментации sitemap — обход всего каталога разом

4.3 Управление скоростью обхода

# Способ 1: robots.txt (Crawl-delay):
User-agent: YandexBot
Crawl-delay: 5

# Способ 2: Яндекс.Вебмастер (рекомендуется):
# Яндекс.Вебмастер → Индексирование → Скорость обхода
# Здесь можно точнее настроить скорость с учётом текущей нагрузки

# Способ 3: Ограничение по IP в Nginx (крайний случай):
# geo $yandex_bot {
#     default 0;
#     77.88.0.0/18 1;
# }
# limit_req_zone $yandex_bot zone=yandex:10m rate=2r/s;

5. Обнаружение в логах

5.1 Как выглядит запись

# Nginx access.log — стандартный запрос YandexBot (Desktop):
77.88.55.60 - - [08/May/2026:22:15:33 +0000] \
  "GET /article/yandex-seo/ HTTP/1.1" \
  200 28432 "-" \
  "Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) \
  AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.268"

# Мобильный запрос:
77.88.55.61 - - [08/May/2026:22:15:35 +0000] \
  "GET /article/yandex-seo/ HTTP/1.1" \
  200 24180 "-" \
  "Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) \
  AppleWebKit/537.36 (KHTML, like Gecko) Chrome/41.0.2272.96 \
  Mobile Safari/537.36 (compatible; YandexBot/3.0; +http://yandex.com/bots)"

# YandexImages — запрос изображения:
77.88.55.62 - - [08/May/2026:22:15:40 +0000] \
  "GET /images/product-photo.jpg HTTP/1.1" \
  200 187432 "https://example.com/catalog/product/" \
  "Mozilla/5.0 (compatible; YandexImages/3.0; +http://yandex.com/bots)"

# MirrorDetector — проверка зеркал:
77.88.55.63 - - [08/May/2026:22:16:00 +0000] \
  "GET / HTTP/1.1" 200 18432 "-" \
  "Mozilla/5.0 (compatible; YandexBot/3.0; MirrorDetector; \
  +http://yandex.com/bots)"

5.2 Аналитика через grep

Найти все запросы YandexBot:

grep -i 'YandexBot' /var/log/nginx/access.log

Все Яндекс-боты сразу:

grep -i 'yandex' /var/log/nginx/access.log \
  | grep -iE 'YandexBot|YandexImages|YandexVideo|YandexNews|YandexDirect'

Подсчитать запросы по типам ботов:

grep -i 'yandex' access.log \
  | grep -oE 'Yandex[A-Za-z]+' \
  | sort | uniq -c | sort -nr

Топ обходимых страниц:

grep -i 'YandexBot' access.log \
  | awk '{print $7}' | sort | uniq -c | sort -nr | head -30

HTTP-коды ответов:

grep -i 'YandexBot' access.log \
  | awk '{print $9}' | sort | uniq -c | sort -nr

Страницы с ошибками (потеря индексации):

grep -i 'YandexBot' access.log \
  | awk '$9 >= 400 {print $7, $9}' \
  | sort | uniq -c | sort -nr | head -20

Bandwidth от YandexBot:

grep -i 'YandexBot' access.log \
  | awk '{sum+=$10} END{print sum/1024/1024 " MB"}'

Активность по часам:

grep -i 'YandexBot' access.log \
  | awk '{print $4}' | cut -d: -f2 | sort | uniq -c | sort -n

Live-мониторинг:

tail -f /var/log/nginx/access.log \
  | grep --line-buffered -i 'YandexBot'

5.3 Верификация подлинности YandexBot

#!/bin/bash
# Проверка: настоящий ли YandexBot?
IP=$1
HOST=$(host $IP | awk '{print $NF}')

if [[ $HOST == *yandex.ru* ]] || [[ $HOST == *yandex.com* ]] \
   || [[ $HOST == *yandex.net* ]]; then
  FWD=$(host $HOST | awk '{print $NF}')
  if [[ $FWD == $IP ]]; then
    echo "✔ Настоящий YandexBot: $IP → $HOST"
  else
    echo "✖ Fake YandexBot (DNS mismatch): $IP"
  fi
else
  echo "✖ Fake YandexBot (нет PTR записи yandex.ru/com/net): $IP"
fi

Массовая верификация всех IP из логов:

grep -i 'YandexBot' access.log \
  | awk '{print $1}' | sort -u \
  | while read IP; do
    HOST=$(host $IP 2>/dev/null | awk '{print $NF}')
    if [[ $HOST == *yandex* ]]; then
      echo "✔ Легитимный: $IP → $HOST"
    else
      echo "✖ Подозрительный: $IP → $HOST"
    fi
  done

6. SEO-оптимизация для Яндекса

6.1 Ключевые отличия SEO в Яндексе от Google

Яндекс имеет свои алгоритмы ранжирования, которые в ряде аспектов отличаются от Google. Для эффективной оптимизации под YandexBot важно учитывать эти особенности.

6.2 Поведенческие факторы

Яндекс официально учитывает поведенческие факторы при ранжировании, используя данные Яндекс.Метрики и Яндекс.Браузера:

  • CTR сниппета в выдаче — кликают ли на ваш результат
  • Время на сайте — как долго пользователь остаётся
  • Показатель отказов — уходят ли сразу
  • Глубина просмотра — сколько страниц просматривают
  • Возвращаемость — возвращаются ли пользователи
<!-- Установите Яндекс.Метрику на все страницы: -->
<!-- https://metrika.yandex.ru -->
<script type="text/javascript">
(function(m,e,t,r,i,k,a){m[i]=m[i]||function(){(m[i].a=m[i].a||[]).push(arguments)};
m[i].l=1*new Date();k=e.createElement(t),a=e.getElementsByTagName(t)[0],
k.async=1,k.src=r,a.parentNode.insertBefore(k,a)})
(window,document,"script","https://mc.yandex.ru/metrika/tag.js","ym");
ym(XXXXXXXX,"init",{clickmap:true,trackLinks:true,accurateTrackBounce:true});
</script>

6.3 Региональность — критичный фактор

Яндекс имеет уникальную систему регионального ранжирования. Для коммерческих запросов («купить», «заказать», «цена») Яндекс показывает результаты с учётом региона пользователя:

<!-- Указать регион сайта/страницы через Schema.org: -->
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "LocalBusiness",
  "name": "Название компании",
  "address": {
    "@type": "PostalAddress",
    "addressLocality": "Москва",
    "addressRegion": "Московская область",
    "addressCountry": "RU"
  },
  "telephone": "+7-495-123-45-67",
  "url": "https://example.com"
}
</script>

<!-- В Яндекс.Вебмастер: Информация о сайте → Регион -->
<!-- Обязательно укажите регион для коммерческих сайтов -->

6.4 Структурированные данные для Яндекса

Яндекс поддерживает Schema.org и использует структурированные данные для расширенных сниппетов. Некоторые типы работают только в Яндексе:

<!-- Хлебные крошки (breadcrumbs) — важны для Яндекса: -->
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {"@type": "ListItem", "position": 1, "name": "Главная", "item": "https://example.com/"},
    {"@type": "ListItem", "position": 2, "name": "Каталог", "item": "https://example.com/catalog/"},
    {"@type": "ListItem", "position": 3, "name": "Товар", "item": "https://example.com/catalog/product/"}
  ]
}
</script>

<!-- Товар с ценой для расширенного сниппета Яндекса: -->
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Product",
  "name": "Название товара",
  "offers": {
    "@type": "Offer",
    "price": "12990",
    "priceCurrency": "RUB",
    "availability": "https://schema.org/InStock"
  },
  "aggregateRating": {
    "@type": "AggregateRating",
    "ratingValue": "4.7",
    "reviewCount": "183"
  }
}
</script>

6.5 Sitemap для Яндекса

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"
        xmlns:xhtml="http://www.w3.org/1999/xhtml">
  <url>
    <loc>https://example.com/page/</loc>
    <lastmod>2026-05-08</lastmod>
    <changefreq>weekly</changefreq>
    <priority>0.8</priority>
  </url>
</urlset>

<!-- Добавить sitemap в Яндекс.Вебмастер:
     Индексирование → Sitemap -->

<!-- Пинг Яндекса при обновлении sitemap: -->
<!-- https://www.yandex.com/ping?sitemap=https://example.com/sitemap.xml -->

7. Управление YandexBot

7.1 robots.txt — полная конфигурация

# ✔ Рекомендуемый robots.txt для русскоязычного сайта:

User-agent: Yandex
Crawl-delay: 2
Clean-param: utm_source&utm_medium&utm_campaign&utm_content&utm_term
Clean-param: sid&session_id&ref&from
Host: https://www.example.com

User-agent: YandexBot
Disallow: /admin/
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Disallow: /*?sort=
Disallow: /*?filter=
Disallow: /*?page=
Disallow: /tag/
Allow: /

User-agent: YandexImages
Disallow: /private/
Allow: /

User-agent: *
Disallow: /admin/
Allow: /

Sitemap: https://example.com/sitemap.xml
Sitemap: https://example.com/news-sitemap.xml

7.2 Полная блокировка YandexBot

# Полная блокировка (выпадение из Яндекс-поиска):
User-agent: YandexBot
Disallow: /

# Блокировка всех Яндекс-ботов:
User-agent: Yandex
Disallow: /

# ВНИМАНИЕ: Это приведёт к исчезновению сайта из выдачи Яндекса.
# Для сайтов с русскоязычной аудиторией — критическая потеря трафика.

7.3 Блокировка через .htaccess (Apache)

RewriteEngine On

# Блокировка YandexBot:
RewriteCond %{HTTP_USER_AGENT} YandexBot [NC]
RewriteRule .* - [F,L]

# Блокировка всех Яндекс-ботов:
RewriteCond %{HTTP_USER_AGENT} "(YandexBot|YandexImages|YandexVideo|YandexNews)" [NC]
RewriteRule .* - [F,L]

# Ограничение скорости через Crawl-delay в .htaccess (альтернатива):
# Используйте robots.txt Crawl-delay — надёжнее

7.4 Блокировка через Nginx

map $http_user_agent $is_yandexbot {
    default         0;
    "~*YandexBot"   1;
    "~*YandexImages" 1;
    "~*YandexVideo" 1;
    "~*YandexNews"  1;
}

# Полная блокировка (только если нет аудитории в РФ):
if ($is_yandexbot) {
    return 403;
}

# Блокировка конкретных разделов:
location /private/ {
    if ($is_yandexbot) {
        return 403;
    }
}

# Rate limiting для Яндекс-ботов:
limit_req_zone $is_yandexbot zone=yandex_bots:10m rate=1r/s;
location / {
    limit_req zone=yandex_bots burst=5 nodelay;
}

7.5 Noindex для Яндекса

<!-- Стандартный noindex (работает для всех ботов): -->
<meta name="robots" content="noindex, nofollow">

<!-- Только для YandexBot: -->
<meta name="robots" content="noindex">

<!-- HTTP-заголовок (Nginx) — для всего сайта или раздела: -->
add_header X-Robots-Tag "noindex, nofollow" always;

8. Яндекс.Вебмастер — управление индексацией

Яндекс.Вебмастер (webmaster.yandex.ru) — главный инструмент управления присутствием сайта в Яндексе. По функциональности аналогичен Google Search Console, но имеет ряд уникальных возможностей.

8.1 Ключевые разделы Яндекс.Вебмастер

Раздел Что даёт Аналог в Google Search Console
Индексирование → Статус обхода Какие страницы обходит и индексирует YandexBot Отчёт об индексировании
Индексирование → Скорость обхода Управление Crawl Rate для YandexBot Настройки обхода (ограничены)
Индексирование → Sitemap Добавление и мониторинг sitemap Sitemaps
Поисковые запросы Запросы, по которым сайт показывается в Яндексе Отчёт об эффективности
Информация о сайте → Регион Привязка к географическому региону Нет прямого аналога
Диагностика → Robots.txt Анализ и проверка robots.txt для Яндекса Robots.txt Tester
Переезд сайта Уведомление о смене домена или протокола Change of address

8.2 Управление скоростью обхода через Вебмастер

# В Яндекс.Вебмастер:
# Индексирование → Скорость обхода → Установить вручную

# Диапазон настройки: от минимальной до максимальной
# Рекомендуется: Оптимизировать автоматически (по умолчанию)

# Когда снижать вручную:
# - Сервер перегружен запросами бота
# - Время ответа сервера > 500ms
# - Много 5xx ошибок в логах

# Альтернатива через robots.txt (Crawl-delay):
User-agent: YandexBot
Crawl-delay: 5  # 5 секунд между запросами

8.3 Переезд сайта

При смене домена или перходе с HTTP на HTTPS Яндекс.Вебмастер предоставляет специальный инструмент, ускоряющий переиндексацию:

# Шаг 1: Настроить 301-редиректы на новый сайт:
# Nginx:
server {
    listen 80;
    server_name old-domain.ru www.old-domain.ru;
    return 301 https://new-domain.ru$request_uri;
}

# Шаг 2: Яндекс.Вебмастер → Переезд сайта
# Указать старый и новый домен
# Яндекс ускорит смену домена в индексе (обычно 2-4 недели вместо нескольких месяцев)

# Шаг 3: Обновить robots.txt на новом домене:
Host: https://new-domain.ru

9. Диагностика проблем

9.1 Типичные проблемы и решения

Проблема Причина Решение
Сайт выпал из Яндекса YandexBot заблокирован в robots.txt или по IP Проверить robots.txt и серверные правила
Медленная индексация новых страниц Нет sitemap или большой Crawl-delay Добавить sitemap + пинг Яндекса
Дубли в индексе Яндекса Параметрические URL без Clean-param Добавить Clean-param в robots.txt + canonical
Сайт в индексе, но не показывается в регионе Не указан регион в Яндекс.Вебмастер Настроить регион в Вебмастере и Schema.org
YandexBot перегружает сервер Нет Crawl-delay, много дублей Добавить Crawl-delay + Clean-param + оптимизировать структуру
Структурированные данные не работают Ошибки в Schema.org Проверить через validator.schema.org
После переезда домена трафик упал Яндекс не знает о переезде Использовать инструмент «Переезд сайта» в Вебмастере

9.2 Пошаговая диагностика

Шаг 1 — Проверить доступность для YandexBot:

curl -A "Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)" \
  -I https://example.com/page/
# Ожидается: HTTP/1.1 200 OK

Шаг 2 — Проверить robots.txt:

curl https://example.com/robots.txt | grep -i 'yandex'
# Убедиться что нет Disallow: / для YandexBot

Шаг 3 — Проверить Clean-param:

# В Яндекс.Вебмастер → Диагностика → Robots.txt
# Проверьте, применяется ли Clean-param к параметрическим URL

Шаг 4 — Проверить наличие дублей:

curl -s https://example.com/page/?utm_source=test \
  | grep -i 'canonical'
# Должен быть: <link rel="canonical" href="https://example.com/page/">

Шаг 5 — Инструменты Яндекса:

  • Яндекс.Вебмастер → Диагностика → Robots.txt — проверить синтаксис
  • Яндекс.Вебмастер → Индексирование → Статус страниц — статус конкретных URL
  • Яндекс.Вебмастер → Проверка страницы — как Яндекс видит страницу
  • validator.schema.org — валидация структурированных данных

10. YandexBot vs другие поисковые боты

Краулер Поисковик User-Agent (кратко) Crawl-delay Рынок
YandexBot Яндекс YandexBot/3.0 ✔ Уважает Россия, СНГ
Googlebot Google Googlebot/2.1 ✖ Игнорирует Глобальный
bingbot Microsoft Bing bingbot/2.0 ✖ Игнорирует США, Европа
Baiduspider Baidu Baiduspider/2.0 ✔ Уважает Китай
DuckDuckBot DuckDuckGo DuckDuckBot/1.1 ✔ Уважает Глобальный
NaverBot Naver Yeti/1.1 ✔ Уважает Корея
AhrefsBot Ahrefs (SEO) AhrefsBot/7.0 Частично Глобальный
SemrushBot Semrush (SEO) SemrushBot/7 Частично Глобальный

 

Полезные ссылки: Яндекс.Вебмастер | Верификация YandexBot | User-Agent в robots.txt Яндекса | IP-диапазоны Яндекса | Яндекс.Метрика

Другие гайды по ботам

Частые вопросы

Чем YandexBot отличается от Googlebot?

Оба бота выполняют схожие задачи — индексируют страницы для поиска. Ключевые отличия YandexBot: он поддерживает директиву Crawl-delay в robots.txt (Googlebot её игнорирует); поддерживает уникальную директиву Clean-param для управления параметрическими URL; имеет директиву Host для указания главного зеркала; учитывает поведенческие факторы через Яндекс.Метрику при ранжировании; имеет развитую систему геотаргетинга для регионов России. Верификация происходит через домены *.yandex.ru/com/net, а не googlebot.com.

Нужно ли блокировать YandexBot, если сайт не нацелен на Россию?

Это зависит от ситуации. Если аудитория полностью вне СНГ — YandexBot создаёт только нагрузку без пользы. В этом случае можно заблокировать через robots.txt или ограничить через Crawl-delay. Однако многие глобальные сайты предпочитают rate limiting вместо полной блокировки — Яндекс всё же индексирует и международные ресурсы. Блокировать имеет смысл если нагрузка ощутима, а трафик из Яндекса нулевой по данным аналитики.

Что такое директива Clean-param и почему она важна?

Clean-param — уникальная директива robots.txt, которую поддерживает только Яндекс. Она указывает, какие URL-параметры являются техническими и не влияют на контент страницы. Без неё Яндекс воспринимает URL вида /page/?utm_source=google и /page/ как разные страницы с одинаковым контентом — это создаёт дубли и тратит crawl budget. С Clean-param: Clean-param: utm_source&utm_medium&utm_campaign — Яндекс понимает, что это одна страница.

Как управлять скоростью обхода YandexBot?

Два способа. Первый — через robots.txt: добавьте Crawl-delay: 5 в секцию User-agent: YandexBot. Это значит пауза 5 секунд между запросами. Второй (предпочтительный) — через Яндекс.Вебмастер: раздел «Индексирование → Скорость обхода». Здесь можно точнее настроить скорость на основе реальных данных о нагрузке. По умолчанию Яндекс самостоятельно рассчитывает оптимальную скорость.

Почему YandexBot не индексирует новые страницы?

Возможные причины: страницы закрыты в robots.txt директивой Disallow; на страницах стоит мета-тег noindex; страницы не включены в sitemap; сайт не добавлен в Яндекс.Вебмастер; большой Crawl-delay замедляет обход; низкий crawl budget из-за большого числа дублей. Проверьте каждый пункт через Яндекс.Вебмастер → Диагностика и сравните логи сервера с данными о статусе страниц.

Как проверить, что в логах именно настоящий YandexBot, а не подделка?

Стандартная двухэтапная DNS-верификация. Шаг 1: host IP_адрес — PTR запись должна указывать на домен вида *.yandex.ru, *.yandex.com или *.yandex.net. Шаг 2: host полученный_хост — должен вернуть исходный IP. Если PTR записи нет или домен не yandex — это подделка. Яндекс также публикует официальные IP-диапазоны на yandex.com/ips.

Что такое MirrorDetector в User-Agent строке YandexBot?

MirrorDetector — специальный режим YandexBot для обнаружения зеркал сайта. Когда Яндекс подозревает, что сайт является зеркалом другого ресурса (например, при одинаковом контенте), он отправляет бота с этим маркером для проверки. Если ваш сайт легитимен, дополнительных действий не требуется. Если вы намеренно используете несколько доменов с одинаковым контентом — укажите главное зеркало через директиву Host в robots.txt.

Влияет ли Яндекс.Метрика на ранжирование в Яндексе?

Официально Яндекс не подтверждает прямое использование данных Метрики для ранжирования конкретного сайта. Однако компания открыто говорит о том, что поведенческие факторы учитываются при ранжировании — а Метрика является основным источником таких данных. Наличие Метрики на сайте практически обязательно для e-commerce и информационных сайтов, нацеленных на Яндекс.

Как правильно настроить регион для YandexBot?

Три шага. Первый — в Яндекс.Вебмастер: раздел «Информация о сайте → Регион» — выберите один или несколько регионов присутствия. Второй — на страницах: добавьте Schema.org разметку с адресом (LocalBusiness с addressLocality и addressRegion). Третий — контент: упоминайте город/регион в тексте, заголовках и мета-описаниях там, где это уместно. Региональность критична для коммерческих запросов — без неё сайт будет проигрывать локальным конкурентам.

Что будет, если полностью заблокировать YandexBot?

Сайт постепенно выпадет из индекса Яндекса. Уже проиндексированные страницы останутся некоторое время, но перестанут обновляться и будут удалены. Новые страницы не появятся в поиске вообще. Для сайтов с российской аудиторией это означает потерю 60%+ органического трафика. Если вы хотите снизить нагрузку без выпадения из поиска — используйте Crawl-delay, Clean-param и оптимизацию структуры сайта.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Claude Search Bot

Claude-SearchBot — краулер Anthropic, отвечающий за качество и релевантность поисковых функций Claude. Он индексирует публичный веб-контент, чтобы Claude мог возвращать актуальные, точные ответы с цитированием источников, когда пользователь задаёт вопрос, требующий свежих данных из интернета. Это не обучающий краулер: собранные данные используются исключительно для поискового слоя Claude, а не для тренировки моделей.

3 мин

Claude User

Claude-User — агент Anthropic, который срабатывает не по расписанию, а по прямому действию пользователя. Когда человек в Claude просит прочитать конкретную страницу, вставляет ссылку в диалог или задаёт вопрос, требующий обращения к конкретному URL, именно Claude-User выполняет этот запрос в моменте. Это не плановый краулер, а реактивный агент, чьё появление в логах коррелирует с объёмом пользовательских запросов, а не с расписанием индексации.

5 мин

ClaudeBot

ClaudeBot — основной краулер Anthropic, который собирает публично доступный веб-контент для обучения и улучшения генеративных моделей семейства Claude. Это самый узнаваемый и старый из трёх официально задокументированных ботов Anthropic, находящийся в центре большей части публичной дискуссии об AI-краулерах — в том числе из-за нашумевших данных Cloudflare о крайне высоком соотношении «сканирование / переходы по ссылкам» у AI-краулеров в целом.

5 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.