MedialogiaBot — не безымянный «прочий сервис», а краулер «Медиалогии» (mlg.ru), одной из крупнейших и наиболее узнаваемых российских компаний в сфере мониторинга СМИ и соцмедиа. По собственным данным компании, система обрабатывает 100 млн сообщений в сутки, мониторит более 800 млн источников в соцсетях и 51 тысячу СМИ, а по отзывам клиентов используется в отрасли уже больше десяти лет как фактический стандарт медиааналитики.
1. Что такое MedialogiaBot на самом деле
«Медиалогия» — информационно-аналитическая система для PR- и SMM-специалистов, аналитиков и служб поддержки: отслеживает упоминания брендов, оценивает тональность (с помощью нейросетей и машинного обучения), считает МедиаИндекс — фирменную метрику качественного присутствия объекта в СМИ, и предоставляет более 50 метрик эффективности коммуникаций. Продукт внесён в государственный реестр российского программного обеспечения.
Чтобы построить эту базу данных, системе нужен собственный краулер, который непрерывно обходит СМИ, блоги, форумы и соцсети — MedialogiaBot, судя по всему, и есть этот компонент. Технически система состоит из двух частей: базы данных и «робота-поисковика» с автоматической системой распознавания и анализа контента — именно эта краулинговая часть и оставляет след в access.log сторонних сайтов.
| Параметр | Значение |
| Название | MedialogiaBot |
| Оператор | «Медиалогия» (mlg.ru) — крупная российская компания, лидер рынка мониторинга СМИ и соцмедиа, продукт в реестре российского ПО |
| Роль | Сбор данных для системы мониторинга упоминаний брендов, анализа тональности и PR/SMM-метрик у клиентов «Медиалогии» |
| User-Agent / паттерн | medialogiabot |
| Масштаб оператора | 100 млн обрабатываемых сообщений в сутки, 800+ млн источников соцмедиа, 51 тыс. СМИ |
| Более точная категория | Мониторинг СМИ/PR-аналитика (в одном ряду с Meltwater, Brandwatch, Awario) — не безликий «прочий сервис» (см. раздел 8) |
| robots.txt | Прямых данных о соблюдении не найдено |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем MedialogiaBot приходит на сайт
- сбор публикаций и упоминаний брендов, персон или тем, которые интересуют клиентов «Медиалогии» — компании, PR-агентства, госструктуры;
- анализ тональности упоминаний и подсчёт МедиаИндекса и других метрик для отчётности клиентов;
- мониторинг СМИ и соцмедиа в реальном или близком к реальному времени режиме — часть заявленной функциональности сервиса.
Типичный кейс: бот концентрируется на новостных разделах, блоге, разделе «Пресс-центр» или страницах, где упоминаются конкретные бренды/персоны — паттерн, характерный именно для медиамониторинга, а не для общего индексирования сайта целиком.
3. Нагрузка и риски
Прямой пользы для владельца сайта, как правило, нет — собранные данные уходят в коммерческий продукт «Медиалогии», доступный её клиентам по подписке, а не возвращаются самому сайту в виде трафика или атрибуции. В этом смысле категория TrafficVeil «нежелательный» обоснована — та же логика, что и для зарубежных аналогов вроде Meltwater или Brandwatch, уже размеченных в базе как нежелательные AdTech/медиа-мониторинговые боты.
При этом стоит учитывать масштаб оператора: с учётом заявленного объёма обрабатываемых источников (800+ млн) нагрузка от такого краулера на отдельный сайт, скорее всего, пропорциональна интересу к конкретному бренду или теме, а не носит агрессивный характер немотивированного полного обхода.
4. Как найти MedialogiaBot в логах
# Базовый поиск
grep -i "medialogiabot" /var/log/nginx/access.log
# Топ URL — ожидаемо новостные/пресс-разделы
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка гипотезы: концентрация на новостных/пресс-разделах
grep -i "medialogiabot" /var/log/nginx/access.log | grep -icE "/news/|/press/|/blog/"
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов не найдено — для решения allow/deny смотрите связку UA + IP/ASN + характерную концентрацию на новостных/пресс-разделах:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для MedialogiaBot
# Жёсткий запрет
User-agent: medialogiabot
Disallow: /
# Разрешить всё
User-agent: medialogiabot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: medialogiabot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "medialogiabot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=medialogiabot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "medialogiabot") {
limit_req zone=medialogiabot burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} medialogiabot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите medialogiabot в разделе ботов домена или в /system/bots;
- для сайтов без интереса к PR-присутствию в базах медиамониторинга — Disallow плюс запрет обоснованы;
- если сайт сам заинтересован в том, чтобы упоминания о нём попадали в отчёты клиентов «Медиалогии» (например, СМИ или новостной ресурс, заинтересованный в цитируемости) — allow может быть осмысленным решением;
- после изменения сверьте логи: хиты MedialogiaBot должны уйти в блок/лимит, а поисковые роботы остаться без изменений.
7. Что делать: короткий алгоритм
- Пользы нет — Disallow/403, для большинства сайтов это безопасно и не влияет на позиции в Google/Яндексе;
- Сайт — СМИ или новостной ресурс, заинтересованный в цитируемости и присутствии в PR-аналитике клиентов «Медиалогии» — allow;
- Нагрузка от обхода заметна — rate-limit как промежуточный шаг перед полным запретом;
- Не путайте MedialogiaBot с обычными «прочими» ботами без ясной цели — это крупный, узнаваемый игрок конкретного рынка медиааналитики;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Стоит рассмотреть перенос MedialogiaBot из общей категории «Прочие краулеры и сервисы» в более точную — рядом с зарубежными аналогами вроде Meltwater, Brandwatch и Awario, которые в этой же энциклопедии уже размечены как медиамониторинговые/AdTech-краулеры. Это не меняет итоговую рекомендацию «нежелательный» для большинства сайтов, но точнее описывает природу и масштаб оператора, чем формулировка «оператор не указан публично».
| Бот / сосед | Кластер | Комментарий |
| Meltwater | Рекламные и AdTech-боты / медиамониторинг | Зарубежный прямой аналог — та же функция мониторинга СМИ и соцсетей |
| Brandwatch | Рекламные и AdTech-боты / медиамониторинг | Зарубежный аналог, тот же тип продукта |
| AwarioRssBot / AwarioSmartBot | AI и LLM-краулеры (в некоторых списках) / медиамониторинг | Ещё один международный аналог мониторинга упоминаний бренда |
| StatOnlineRuBot | SEO и backlink-краулеры (см. отдельную статью) | Тоже крупный российский оператор (REG.RU) — похожий случай «оператор реален, но польза для сайта не прямая» |
9. Стратегия allow/deny для MedialogiaBot
| Ситуация | Действие |
| Обычный сайт без интереса к PR-мониторингу | Disallow + запрет в TrafficVeil |
| СМИ или ресурс, заинтересованный в цитируемости у клиентов «Медиалогии» | Allow |
| Нужен доступ, но обход создаёт пики нагрузки | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil, но не критичен | Deny по умолчанию — прямой пользы для сайта всё равно нет |
| Подозрение на подделку UA | Не доверять строке UA; смотреть ASN и характер обхода (концентрация на новостных/пресс-разделах) |