Боты5 мин чтения·11 августа 2026 г.

MailRUBot: два разных бота под похожими именами — и ни один не собирает данные для обучения AI

Под именем MailRUBot скрывается путаница минимум двух разных агентов: полноценный поисковый индексатор Mail.RU_Bot (VK Group, с 2009 года) и отдельный fetcher для email-превью ссылок. Разбираем, почему это не AI-краулер для обучающих датасетов, как отличить два варианта по точному написанию токена и паттерну обхода, и как настроить robots.txt для каждого сценария.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота MailRUBot: нежелательный ai и llm-краулеры

Прежде чем присваивать этому боту ярлык «AI-краулер, ворующий контент для обучения моделей», стоит внимательно посмотреть на точное написание строки в логах — потому что под очень похожими именами скрываются как минимум два разных бота с разными задачами, и один из них работает с 2009 года как вполне легитимный поисковый индексатор одного из крупнейших рунет-порталов.

Два разных бота под похожими именами

Основной и наиболее известный краулер — Mail.RU_Bot (с точкой и подчёркиванием), который принадлежит VK Group (бывшая Mail.ru Group) и служит поисковым индексатором для собственного поиска компании — крупнейшего портала Рунета, который часто сравнивают с западным Yahoo по масштабу и роли на локальном рынке. Развёрнутая строка выглядит как Mozilla/5.0 (compatible; Mail.RU_Bot/2.0; +http://go.mail.ru/help/robots), есть и специализированные варианты — например, Mail.RU_Bot/Img/2.0 для индексации изображений. Этот бот методично проходит по ссылкам, скачивает и анализирует текст, изображения и другие элементы страницы, чтобы определить релевантность и качество контента для поисковой выдачи, ориентированной на русскоязычную аудиторию, — и, по независимым описаниям, в целом соблюдает стандартные протоколы обхода и правила robots.txt.

Отдельно от него в некоторых каталогах ботов фигурирует именно MailRUBot (без точки и подчёркивания) — который описывается уже не как краулер поисковой индексации, а как fetcher: агент, который забирает метаданные конкретной страницы для построения превью ссылки при пересылке в email или мессенджере от лица почтового сервиса Mail.ru, а не системно обходит сайт целиком. Логика здесь такая же, как у ботов Slack или Reddit из этой серии: точечный запрос по факту действия пользователя, а не фоновое накопление обучающего датасета.

Параметры

Параметр Значение
Токен поискового краулера Mail.RU_Bot — точка и подчёркивание в написании имеют значение
Оператор VK Group (бывшая Mail.ru Group)
Год появления Развёрнут примерно с 2009 года как индексатор для поиска Mail.ru
Назначение Индексация контента для собственной поисковой выдачи Mail.ru, ориентированной на русскоязычных пользователей — не для стороннего AI-продукта
Соблюдение robots.txt По независимым описаниям — да, в целом соблюдает
Отдельный fetcher-агент MailRUBot (без точки/подчёркивания) — в части каталогов описывается как агент построения превью ссылок для почтового сервиса, точный оператор в открытых источниках указан менее однозначно
Список IP-адресов Официального современного фида не найдено; по историческим наблюдениям сообщества вебмастеров, трафик исходил из диапазонов вроде 217.69.128.0/20 и 95.163.64.0/18 — актуальность таких списков стоит перепроверять

Почему исходная классификация «AI-краулер для обучающих датасетов» вводит в заблуждение

Оба реальных описания этого имени — и полноценный поисковый индексатор Mail.ru, и отдельный fetcher для email-превью — принципиально отличаются от типового AI-краулера, вычитывающего контент как сырьё для обучения языковой модели. Поисковый индексатор существует и работает уже больше пятнадцати лет ради вполне традиционной задачи — построения поисковой выдачи, а не тренировки LLM; fetcher же вовсе не занимается систематическим обходом. Если в логах конкретного сайта присутствует именно паттерн системного, повторяющегося обхода блога, каталога и пагинации под именем «mailrubot» — стоит в первую очередь свериться с точным написанием токена и его поведением, а не сразу относить трафик к категории обучающих AI-скрейперов.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти в логах и различить варианты

# Общий поиск по семье имён
grep -iE "mail\.?ru[_]?bot" /var/log/nginx/access.log

# Отдельно — паттерн полноценного обхода (карточки, пагинация) против единичных точечных запросов
grep -i "mail" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Широкий, регулярный обход разных разделов сайта скорее соответствует поведению поискового индексатора Mail.RU_Bot; единичные обращения к конкретным URL без явной системности — больше похожи на fetcher, сработавший по факту пересылки ссылки пользователем почтового сервиса.

Стоит ли блокировать

Решение стоит принимать по-разному для двух сценариев:

  • если это полноценный поисковый индексатор Mail.RU_Bot и сайт заинтересован в присутствии в поиске Mail.ru (актуально для проектов с русскоязычной аудиторией) — блокировка напрямую снижает видимость в этом поисковике, отдельном от Google, Bing и Яндекса;
  • если это точечный fetcher для email-превью — блокировка ухудшит вид ссылок при пересылке в письмах от пользователей Mail.ru, но не повлияет на позиции ни в одной поисковой системе;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие любого из этих ботов не влияет — это отдельная от них экосистема.

Как настроить robots.txt

Разрешение для полноценного поискового индексатора:

User-agent: Mail.RU_Bot
Allow: /

Частичное ограничение — закрыть служебные разделы, оставив остальной сайт доступным для индексации:

User-agent: Mail.RU_Bot
Disallow: /admin/
Disallow: /cart/
Allow: /

Полный запрет, если присутствие в поиске Mail.ru не имеет значения для сайта:

User-agent: Mail.RU_Bot
Disallow: /
if ($http_user_agent ~* "mail\.?ru[_]?bot") {
    return 403;
}

Частые вопросы

MailRUBot собирает данные для обучения AI-моделей?
Нет, под этим именем скрываются либо полноценный поисковый индексатор Mail.ru, работающий с 2009 года, либо отдельный fetcher для email-превью — ни один не связан с обучением языковых моделей.
Как отличить поисковый индексатор от fetcher-агента?
По точному написанию токена (Mail.RU_Bot с точкой и подчёркиванием у поискового индексатора) и по паттерну обхода — системный обход разных разделов против единичных точечных запросов.
Кто владеет полноценным поисковым краулером Mail.RU_Bot?
VK Group, бывшая Mail.ru Group — крупнейший портал Рунета.
Соблюдает ли Mail.RU_Bot правила robots.txt?
По независимым описаниям, в целом да — соблюдает стандартные протоколы обхода.
Стоит ли блокировать этот бот, если сайт не ориентирован на русскоязычную аудиторию?
Можно блокировать без серьёзных потерь — присутствие в поиске Mail.ru наиболее ценно именно для проектов с русскоязычной аудиторией.
Повлияет ли блокировка на позиции в Google, Bing или Яндексе?
Нет, это отдельная от них поисковая и сервисная экосистема.
#mailrubot#Mail.RU_Bot#VK Group#поисковый индексатор#бот-энциклопедия#robots.txt#email-превью#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil