MedialogiaBot — не безымянный «прочий сервис», а краулер «Медиалогии» (mlg.ru), одной из крупнейших и наиболее узнаваемых российских компаний в сфере мониторинга СМИ и соцмедиа. По собственным данным компании, система обрабатывает 100 млн сообщений в сутки, мониторит более 800 млн источников в соцсетях и 51 тысячу СМИ, а по отзывам клиентов используется в отрасли уже больше десяти лет как фактический стандарт медиааналитики.
1. Что такое MedialogiaBot на самом деле
«Медиалогия» — информационно-аналитическая система для PR- и SMM-специалистов, аналитиков и служб поддержки: отслеживает упоминания брендов, оценивает тональность (с помощью нейросетей и машинного обучения), считает МедиаИндекс — фирменную метрику качественного присутствия объекта в СМИ, и предоставляет более 50 метрик эффективности коммуникаций. Продукт внесён в государственный реестр российского программного обеспечения.
Чтобы построить эту базу данных, системе нужен собственный краулер, который непрерывно обходит СМИ, блоги, форумы и соцсети — MedialogiaBot, судя по всему, и есть этот компонент. Технически система состоит из двух частей: базы данных и «робота-поисковика» с автоматической системой распознавания и анализа контента — именно эта краулинговая часть и оставляет след в access.log сторонних сайтов.
| Параметр | Значение |
| Название | MedialogiaBot |
| Оператор | «Медиалогия» (mlg.ru) — крупная российская компания, лидер рынка мониторинга СМИ и соцмедиа, продукт в реестре российского ПО |
| Роль | Сбор данных для системы мониторинга упоминаний брендов, анализа тональности и PR/SMM-метрик у клиентов «Медиалогии» |
| User-Agent / паттерн | medialogiabot |
| Масштаб оператора | 100 млн обрабатываемых сообщений в сутки, 800+ млн источников соцмедиа, 51 тыс. СМИ |
| Более точная категория | Мониторинг СМИ/PR-аналитика (в одном ряду с Meltwater, Brandwatch, Awario) — не безликий «прочий сервис» (см. раздел 8) |
| robots.txt | Прямых данных о соблюдении не найдено |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем MedialogiaBot приходит на сайт
- сбор публикаций и упоминаний брендов, персон или тем, которые интересуют клиентов «Медиалогии» — компании, PR-агентства, госструктуры;
- анализ тональности упоминаний и подсчёт МедиаИндекса и других метрик для отчётности клиентов;
- мониторинг СМИ и соцмедиа в реальном или близком к реальному времени режиме — часть заявленной функциональности сервиса.
Типичный кейс: бот концентрируется на новостных разделах, блоге, разделе «Пресс-центр» или страницах, где упоминаются конкретные бренды/персоны — паттерн, характерный именно для медиамониторинга, а не для общего индексирования сайта целиком.
3. Нагрузка и риски
Прямой пользы для владельца сайта, как правило, нет — собранные данные уходят в коммерческий продукт «Медиалогии», доступный её клиентам по подписке, а не возвращаются самому сайту в виде трафика или атрибуции. В этом смысле категория TrafficVeil «нежелательный» обоснована — та же логика, что и для зарубежных аналогов вроде Meltwater или Brandwatch, уже размеченных в базе как нежелательные AdTech/медиа-мониторинговые боты.
При этом стоит учитывать масштаб оператора: с учётом заявленного объёма обрабатываемых источников (800+ млн) нагрузка от такого краулера на отдельный сайт, скорее всего, пропорциональна интересу к конкретному бренду или теме, а не носит агрессивный характер немотивированного полного обхода.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти MedialogiaBot в логах
# Базовый поиск
grep -i "medialogiabot" /var/log/nginx/access.log
# Топ URL — ожидаемо новостные/пресс-разделы
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка гипотезы: концентрация на новостных/пресс-разделах
grep -i "medialogiabot" /var/log/nginx/access.log | grep -icE "/news/|/press/|/blog/"
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов не найдено — для решения allow/deny смотрите связку UA + IP/ASN + характерную концентрацию на новостных/пресс-разделах:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для MedialogiaBot
# Жёсткий запрет
User-agent: medialogiabot
Disallow: /
# Разрешить всё
User-agent: medialogiabot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: medialogiabot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "medialogiabot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=medialogiabot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "medialogiabot") {
limit_req zone=medialogiabot burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} medialogiabot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите medialogiabot в разделе ботов домена или в /system/bots;
- для сайтов без интереса к PR-присутствию в базах медиамониторинга — Disallow плюс запрет обоснованы;
- если сайт сам заинтересован в том, чтобы упоминания о нём попадали в отчёты клиентов «Медиалогии» (например, СМИ или новостной ресурс, заинтересованный в цитируемости) — allow может быть осмысленным решением;
- после изменения сверьте логи: хиты MedialogiaBot должны уйти в блок/лимит, а поисковые роботы остаться без изменений.
7. Что делать: короткий алгоритм
- Пользы нет — Disallow/403, для большинства сайтов это безопасно и не влияет на позиции в Google/Яндексе;
- Сайт — СМИ или новостной ресурс, заинтересованный в цитируемости и присутствии в PR-аналитике клиентов «Медиалогии» — allow;
- Нагрузка от обхода заметна — rate-limit как промежуточный шаг перед полным запретом;
- Не путайте MedialogiaBot с обычными «прочими» ботами без ясной цели — это крупный, узнаваемый игрок конкретного рынка медиааналитики;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Стоит рассмотреть перенос MedialogiaBot из общей категории «Прочие краулеры и сервисы» в более точную — рядом с зарубежными аналогами вроде Meltwater, Brandwatch и Awario, которые в этой же энциклопедии уже размечены как медиамониторинговые/AdTech-краулеры. Это не меняет итоговую рекомендацию «нежелательный» для большинства сайтов, но точнее описывает природу и масштаб оператора, чем формулировка «оператор не указан публично».
| Бот / сосед | Кластер | Комментарий |
| Meltwater | Рекламные и AdTech-боты / медиамониторинг | Зарубежный прямой аналог — та же функция мониторинга СМИ и соцсетей |
| Brandwatch | Рекламные и AdTech-боты / медиамониторинг | Зарубежный аналог, тот же тип продукта |
| AwarioRssBot / AwarioSmartBot | AI и LLM-краулеры (в некоторых списках) / медиамониторинг | Ещё один международный аналог мониторинга упоминаний бренда |
| StatOnlineRuBot | SEO и backlink-краулеры (см. отдельную статью) | Тоже крупный российский оператор (REG.RU) — похожий случай «оператор реален, но польза для сайта не прямая» |
9. Стратегия allow/deny для MedialogiaBot
| Ситуация | Действие |
| Обычный сайт без интереса к PR-мониторингу | Disallow + запрет в TrafficVeil |
| СМИ или ресурс, заинтересованный в цитируемости у клиентов «Медиалогии» | Allow |
| Нужен доступ, но обход создаёт пики нагрузки | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil, но не критичен | Deny по умолчанию — прямой пользы для сайта всё равно нет |
| Подозрение на подделку UA | Не доверять строке UA; смотреть ASN и характер обхода (концентрация на новостных/пресс-разделах) |
Частые вопросы
MedialogiaBot — это анонимный сборщик данных?
Зачем «Медиалогии» нужен собственный краулер?
Есть ли прямая польза для владельца сайта от этого бота?
Чем MedialogiaBot похож на Meltwater или Brandwatch?
Стоит ли блокировать этот бот на новостном сайте?
На каких разделах сайта чаще всего фиксируется активность бота?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.