Прежде чем присваивать этому боту ярлык «AI-краулер, ворующий контент для обучения моделей», стоит внимательно посмотреть на точное написание строки в логах — потому что под очень похожими именами скрываются как минимум два разных бота с разными задачами, и один из них работает с 2009 года как вполне легитимный поисковый индексатор одного из крупнейших рунет-порталов.
Два разных бота под похожими именами
Основной и наиболее известный краулер — Mail.RU_Bot (с точкой и подчёркиванием), который принадлежит VK Group (бывшая Mail.ru Group) и служит поисковым индексатором для собственного поиска компании — крупнейшего портала Рунета, который часто сравнивают с западным Yahoo по масштабу и роли на локальном рынке. Развёрнутая строка выглядит как Mozilla/5.0 (compatible; Mail.RU_Bot/2.0; +http://go.mail.ru/help/robots), есть и специализированные варианты — например, Mail.RU_Bot/Img/2.0 для индексации изображений. Этот бот методично проходит по ссылкам, скачивает и анализирует текст, изображения и другие элементы страницы, чтобы определить релевантность и качество контента для поисковой выдачи, ориентированной на русскоязычную аудиторию, — и, по независимым описаниям, в целом соблюдает стандартные протоколы обхода и правила robots.txt.
Отдельно от него в некоторых каталогах ботов фигурирует именно MailRUBot (без точки и подчёркивания) — который описывается уже не как краулер поисковой индексации, а как fetcher: агент, который забирает метаданные конкретной страницы для построения превью ссылки при пересылке в email или мессенджере от лица почтового сервиса Mail.ru, а не системно обходит сайт целиком. Логика здесь такая же, как у ботов Slack или Reddit из этой серии: точечный запрос по факту действия пользователя, а не фоновое накопление обучающего датасета.
Параметры
| Параметр | Значение |
| Токен поискового краулера | Mail.RU_Bot — точка и подчёркивание в написании имеют значение |
| Оператор | VK Group (бывшая Mail.ru Group) |
| Год появления | Развёрнут примерно с 2009 года как индексатор для поиска Mail.ru |
| Назначение | Индексация контента для собственной поисковой выдачи Mail.ru, ориентированной на русскоязычных пользователей — не для стороннего AI-продукта |
| Соблюдение robots.txt | По независимым описаниям — да, в целом соблюдает |
| Отдельный fetcher-агент | MailRUBot (без точки/подчёркивания) — в части каталогов описывается как агент построения превью ссылок для почтового сервиса, точный оператор в открытых источниках указан менее однозначно |
| Список IP-адресов | Официального современного фида не найдено; по историческим наблюдениям сообщества вебмастеров, трафик исходил из диапазонов вроде 217.69.128.0/20 и 95.163.64.0/18 — актуальность таких списков стоит перепроверять |
Почему исходная классификация «AI-краулер для обучающих датасетов» вводит в заблуждение
Оба реальных описания этого имени — и полноценный поисковый индексатор Mail.ru, и отдельный fetcher для email-превью — принципиально отличаются от типового AI-краулера, вычитывающего контент как сырьё для обучения языковой модели. Поисковый индексатор существует и работает уже больше пятнадцати лет ради вполне традиционной задачи — построения поисковой выдачи, а не тренировки LLM; fetcher же вовсе не занимается систематическим обходом. Если в логах конкретного сайта присутствует именно паттерн системного, повторяющегося обхода блога, каталога и пагинации под именем «mailrubot» — стоит в первую очередь свериться с точным написанием токена и его поведением, а не сразу относить трафик к категории обучающих AI-скрейперов.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти в логах и различить варианты
# Общий поиск по семье имён
grep -iE "mail\.?ru[_]?bot" /var/log/nginx/access.log
# Отдельно — паттерн полноценного обхода (карточки, пагинация) против единичных точечных запросов
grep -i "mail" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Широкий, регулярный обход разных разделов сайта скорее соответствует поведению поискового индексатора Mail.RU_Bot; единичные обращения к конкретным URL без явной системности — больше похожи на fetcher, сработавший по факту пересылки ссылки пользователем почтового сервиса.
Стоит ли блокировать
Решение стоит принимать по-разному для двух сценариев:
- если это полноценный поисковый индексатор Mail.RU_Bot и сайт заинтересован в присутствии в поиске Mail.ru (актуально для проектов с русскоязычной аудиторией) — блокировка напрямую снижает видимость в этом поисковике, отдельном от Google, Bing и Яндекса;
- если это точечный fetcher для email-превью — блокировка ухудшит вид ссылок при пересылке в письмах от пользователей Mail.ru, но не повлияет на позиции ни в одной поисковой системе;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие любого из этих ботов не влияет — это отдельная от них экосистема.
Как настроить robots.txt
Разрешение для полноценного поискового индексатора:
User-agent: Mail.RU_Bot
Allow: /
Частичное ограничение — закрыть служебные разделы, оставив остальной сайт доступным для индексации:
User-agent: Mail.RU_Bot
Disallow: /admin/
Disallow: /cart/
Allow: /
Полный запрет, если присутствие в поиске Mail.ru не имеет значения для сайта:
User-agent: Mail.RU_Bot
Disallow: /
if ($http_user_agent ~* "mail\.?ru[_]?bot") {
return 403;
}Частые вопросы
MailRUBot собирает данные для обучения AI-моделей?
Как отличить поисковый индексатор от fetcher-агента?
Кто владеет полноценным поисковым краулером Mail.RU_Bot?
Соблюдает ли Mail.RU_Bot правила robots.txt?
Стоит ли блокировать этот бот, если сайт не ориентирован на русскоязычную аудиторию?
Повлияет ли блокировка на позиции в Google, Bing или Яндексе?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.