TrafficVeil
Боты 6 мин21 августа 2026 г.

MedialogiaBot: краулер крупнейшей системы медиамониторинга РФ

MedialogiaBot принадлежит не безымянному оператору, а «Медиалогии» — лидеру российского рынка мониторинга СМИ и соцмедиа с продуктом в реестре отечественного ПО. Разбираемся, зачем компании, обрабатывающей 100 млн сообщений в сутки, нужен собственный краулер, и почему для большинства сайтов рекомендация остаётся прежней, несмотря на солидность оператора.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое MedialogiaBot на самом деле
  2. 2. Зачем MedialogiaBot приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти MedialogiaBot в логах
  5. 5. robots.txt для MedialogiaBot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для MedialogiaBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

MedialogiaBot — не безымянный «прочий сервис», а краулер «Медиалогии» (mlg.ru), одной из крупнейших и наиболее узнаваемых российских компаний в сфере мониторинга СМИ и соцмедиа. По собственным данным компании, система обрабатывает 100 млн сообщений в сутки, мониторит более 800 млн источников в соцсетях и 51 тысячу СМИ, а по отзывам клиентов используется в отрасли уже больше десяти лет как фактический стандарт медиааналитики.

1. Что такое MedialogiaBot на самом деле

«Медиалогия» — информационно-аналитическая система для PR- и SMM-специалистов, аналитиков и служб поддержки: отслеживает упоминания брендов, оценивает тональность (с помощью нейросетей и машинного обучения), считает МедиаИндекс — фирменную метрику качественного присутствия объекта в СМИ, и предоставляет более 50 метрик эффективности коммуникаций. Продукт внесён в государственный реестр российского программного обеспечения.

Чтобы построить эту базу данных, системе нужен собственный краулер, который непрерывно обходит СМИ, блоги, форумы и соцсети — MedialogiaBot, судя по всему, и есть этот компонент. Технически система состоит из двух частей: базы данных и «робота-поисковика» с автоматической системой распознавания и анализа контента — именно эта краулинговая часть и оставляет след в access.log сторонних сайтов.

Параметр Значение
Название MedialogiaBot
Оператор «Медиалогия» (mlg.ru) — крупная российская компания, лидер рынка мониторинга СМИ и соцмедиа, продукт в реестре российского ПО
Роль Сбор данных для системы мониторинга упоминаний брендов, анализа тональности и PR/SMM-метрик у клиентов «Медиалогии»
User-Agent / паттерн medialogiabot
Масштаб оператора 100 млн обрабатываемых сообщений в сутки, 800+ млн источников соцмедиа, 51 тыс. СМИ
Более точная категория Мониторинг СМИ/PR-аналитика (в одном ряду с Meltwater, Brandwatch, Awario) — не безликий «прочий сервис» (см. раздел 8)
robots.txt Прямых данных о соблюдении не найдено
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем MedialogiaBot приходит на сайт

  • сбор публикаций и упоминаний брендов, персон или тем, которые интересуют клиентов «Медиалогии» — компании, PR-агентства, госструктуры;
  • анализ тональности упоминаний и подсчёт МедиаИндекса и других метрик для отчётности клиентов;
  • мониторинг СМИ и соцмедиа в реальном или близком к реальному времени режиме — часть заявленной функциональности сервиса.

Типичный кейс: бот концентрируется на новостных разделах, блоге, разделе «Пресс-центр» или страницах, где упоминаются конкретные бренды/персоны — паттерн, характерный именно для медиамониторинга, а не для общего индексирования сайта целиком.

3. Нагрузка и риски

Прямой пользы для владельца сайта, как правило, нет — собранные данные уходят в коммерческий продукт «Медиалогии», доступный её клиентам по подписке, а не возвращаются самому сайту в виде трафика или атрибуции. В этом смысле категория TrafficVeil «нежелательный» обоснована — та же логика, что и для зарубежных аналогов вроде Meltwater или Brandwatch, уже размеченных в базе как нежелательные AdTech/медиа-мониторинговые боты.

При этом стоит учитывать масштаб оператора: с учётом заявленного объёма обрабатываемых источников (800+ млн) нагрузка от такого краулера на отдельный сайт, скорее всего, пропорциональна интересу к конкретному бренду или теме, а не носит агрессивный характер немотивированного полного обхода.

4. Как найти MedialogiaBot в логах

# Базовый поиск
grep -i "medialogiabot" /var/log/nginx/access.log

# Топ URL — ожидаемо новостные/пресс-разделы
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "medialogiabot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверка гипотезы: концентрация на новостных/пресс-разделах
grep -i "medialogiabot" /var/log/nginx/access.log | grep -icE "/news/|/press/|/blog/"

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов не найдено — для решения allow/deny смотрите связку UA + IP/ASN + характерную концентрацию на новостных/пресс-разделах:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для MedialogiaBot

# Жёсткий запрет
User-agent: medialogiabot
Disallow: /

# Разрешить всё
User-agent: medialogiabot
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: medialogiabot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "medialogiabot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=medialogiabot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "medialogiabot") {
        limit_req zone=medialogiabot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} medialogiabot [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите medialogiabot в разделе ботов домена или в /system/bots;
  • для сайтов без интереса к PR-присутствию в базах медиамониторинга — Disallow плюс запрет обоснованы;
  • если сайт сам заинтересован в том, чтобы упоминания о нём попадали в отчёты клиентов «Медиалогии» (например, СМИ или новостной ресурс, заинтересованный в цитируемости) — allow может быть осмысленным решением;
  • после изменения сверьте логи: хиты MedialogiaBot должны уйти в блок/лимит, а поисковые роботы остаться без изменений.

7. Что делать: короткий алгоритм

  • Пользы нет — Disallow/403, для большинства сайтов это безопасно и не влияет на позиции в Google/Яндексе;
  • Сайт — СМИ или новостной ресурс, заинтересованный в цитируемости и присутствии в PR-аналитике клиентов «Медиалогии» — allow;
  • Нагрузка от обхода заметна — rate-limit как промежуточный шаг перед полным запретом;
  • Не путайте MedialogiaBot с обычными «прочими» ботами без ясной цели — это крупный, узнаваемый игрок конкретного рынка медиааналитики;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит рассмотреть перенос MedialogiaBot из общей категории «Прочие краулеры и сервисы» в более точную — рядом с зарубежными аналогами вроде Meltwater, Brandwatch и Awario, которые в этой же энциклопедии уже размечены как медиамониторинговые/AdTech-краулеры. Это не меняет итоговую рекомендацию «нежелательный» для большинства сайтов, но точнее описывает природу и масштаб оператора, чем формулировка «оператор не указан публично».

Бот / сосед Кластер Комментарий
Meltwater Рекламные и AdTech-боты / медиамониторинг Зарубежный прямой аналог — та же функция мониторинга СМИ и соцсетей
Brandwatch Рекламные и AdTech-боты / медиамониторинг Зарубежный аналог, тот же тип продукта
AwarioRssBot / AwarioSmartBot AI и LLM-краулеры (в некоторых списках) / медиамониторинг Ещё один международный аналог мониторинга упоминаний бренда
StatOnlineRuBot SEO и backlink-краулеры (см. отдельную статью) Тоже крупный российский оператор (REG.RU) — похожий случай «оператор реален, но польза для сайта не прямая»

9. Стратегия allow/deny для MedialogiaBot

Ситуация Действие
Обычный сайт без интереса к PR-мониторингу Disallow + запрет в TrafficVeil
СМИ или ресурс, заинтересованный в цитируемости у клиентов «Медиалогии» Allow
Нужен доступ, но обход создаёт пики нагрузки Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil, но не критичен Deny по умолчанию — прямой пользы для сайта всё равно нет
Подозрение на подделку UA Не доверять строке UA; смотреть ASN и характер обхода (концентрация на новостных/пресс-разделах)

Частые вопросы

MedialogiaBot — это анонимный сборщик данных?

Нет, оператор — «Медиалогия», крупная российская компания, лидер рынка мониторинга СМИ и соцмедиа, продукт в реестре отечественного ПО.

Зачем «Медиалогии» нужен собственный краулер?

Чтобы собирать публикации и упоминания брендов из СМИ и соцсетей для аналитики тональности и PR-метрик своих клиентов.

Есть ли прямая польза для владельца сайта от этого бота?

Как правило нет — собранные данные уходят в коммерческий продукт для клиентов компании, а не возвращаются сайту в виде трафика.

Чем MedialogiaBot похож на Meltwater или Brandwatch?

Той же функцией — это российский аналог зарубежных систем медиамониторинга, уже размеченных в базе как похожая категория ботов.

Стоит ли блокировать этот бот на новостном сайте?

Не обязательно — если ресурс заинтересован в цитируемости и присутствии в PR-отчётах клиентов «Медиалогии», allow может быть осмысленным решением.

На каких разделах сайта чаще всего фиксируется активность бота?

На новостных и пресс-разделах — паттерн, характерный именно для медиамониторинга, а не общего индексирования сайта.

#MedialogiaBot#Медиалогия#мониторинг СМИ#PR-аналитика#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.