TrafficVeil
Боты 6 мин21 августа 2026 г.

McontextualBot: оператор сам подтверждает рекламную цель

В отличие от многих ботов с похожими названиями, McontextualBot имеет официальную страницу оператора MContextual, где прямо написано о сборе контента для контекстной рекламы, и подтверждён рабочий способ блокировки через robots.txt. Разбираемся, почему сверка по IP здесь малоинформативна из-за облачной инфраструктуры AWS/GCP и когда allow может быть осмысленным решением для монетизирующихся рекламой сайтов.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое McontextualBot на самом деле
  2. 2. Зачем McontextualBot приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти McontextualBot в логах
  5. 5. robots.txt для McontextualBot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для McontextualBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

McontextualBot — редкий случай, когда у краулера есть собственная официальная страница с прямым признанием цели обхода. Оператор — компания MContextual (mcontextual.net), которая сама пишет на своём сайте: бот сканирует сайты в целях контекстной рекламы. Это не предположение по названию, как в некоторых других статьях этой энциклопедии, а прямое заявление оператора.

1. Что такое McontextualBot на самом деле

MContextual — рекламная компания, чей краулер собирает содержимое сайтов для контекстного таргетинга рекламы: определения темы и характера страницы, чтобы затем рекомендовать рекламодателям подходящие площадки для размещения объявлений. Официальная страница оператора прямо подтверждает это назначение и даёт точную строку User-Agent.

Mozilla/5.0 (compatible; McontextualBot/0.1; +http://mcontextual.net/mcontextual-bot)

Там же оператор указывает практическую деталь для верификации: запросы бота идут с адресов AWS и GCP — то есть с облачной инфраструктуры, а не с выделенного корпоративного диапазона. Это значит, что сверка по ASN сама по себе малоинформативна: и легитимный McontextualBot, и потенциальный спуфер могут в равной степени оказаться в облаке одного из этих провайдеров.

Параметр Значение
Название McontextualBot
Оператор MContextual (mcontextual.net) — официально подтверждено самим оператором, не предположение
Роль Сбор содержимого сайтов для контекстного таргетинга рекламы у клиентов-рекламодателей
User-Agent / паттерн Mozilla/5.0 (compatible; McontextualBot/0.1; +http://mcontextual.net/mcontextual-bot)
Инфраструктура По заявлению самого оператора — AWS и GCP, а не выделенный корпоративный диапазон
robots.txt Официально подтверждено оператором: бота можно заблокировать стандартными директивами robots.txt
Статистика (независимые данные) 0% топ-1000 сайтов блокируют McontextualBot; основной трафик идёт из США
Более точная категория Рекламные и AdTech-боты (контекстный таргетинг) — не безликий «прочий сервис»
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы — категория, вероятно, требует уточнения (см. раздел 8)

2. Зачем McontextualBot приходит на сайт

  • оценка тематики и содержания страницы для контекстного размещения рекламы — определяет, подходит ли данная страница для показа объявлений конкретных категорий рекламодателей;
  • сбор данных не связан с интересами владельца сайта напрямую: результат используется рекламной платформой MContextual и её клиентами, а не возвращается самому сайту;
  • поскольку это intelligence gatherer-тип бота, паттерн обхода может быть неравномерным — активнее там, где размещение рекламы актуально для текущих клиентов оператора.

Типичный кейс: бот проверяет публичные страницы сайта без выраженной концентрации на конкретных технических или служебных разделах — интерес представляет содержательная часть страниц, которая может быть оценена для контекстного таргетинга.

3. Нагрузка и риски

Прямой пользы для владельца сайта, как правило, нет — данные уходят в рекламную инфраструктуру MContextual и используется для решений о размещении чужой рекламы, а не возвращаются сайту в виде трафика или дохода. Показательно, что независимая статистика фиксирует 0% блокировки среди топовых сайтов — большинство владельцев либо не замечают этот трафик, либо не считают его достаточно значимым, чтобы реагировать.

Поскольку инфраструктура бота — общедоступные облачные адреса AWS/GCP, а не выделенный диапазон, IP-адрес сам по себе слабый сигнал для верификации: нужно смотреть именно на полную строку UA и характер обхода, а не полагаться на принадлежность IP крупному облачному провайдеру как на признак легитимности или, наоборот, подозрительности.

4. Как найти McontextualBot в логах

# Базовый поиск
grep -i "mcontextualbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "mcontextualbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — не показатель сам по себе из-за облачной инфраструктуры
grep -i "mcontextualbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "mcontextualbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Строку UA подделать может любой скрипт. Официального публикуемого списка конкретных IP нет — только общее указание на AWS/GCP, поэтому сверка по принадлежности облаку малоинформативна. Для решения allow/deny смотрите полную строку UA (включая версию и ссылку на mcontextual.net) в связке с характером обхода:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для McontextualBot

# Жёсткий запрет — официально подтверждённый оператором рабочий способ
User-agent: McontextualBot
Disallow: /

# Разрешить всё
User-agent: McontextualBot
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: McontextualBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

В отличие от многих других записей энциклопедии, здесь блокировка через robots.txt — не просто пожелание, а официально подтверждённый самим оператором рабочий метод.

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "mcontextualbot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=mcontextualbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "mcontextualbot") {
        limit_req zone=mcontextualbot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} mcontextualbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите mcontextualbot в разделе ботов домена или в /system/bots;
  • поскольку robots.txt здесь официально подтверждённо работает, для большинства сайтов без интереса к контекстной рекламной аналитике достаточно простого Disallow без необходимости в жёсткой серверной блокировке;
  • если сайт монетизируется через программатик-рекламу и заинтересован в контекстном таргетинге — allow может быть осмысленным решением;
  • после изменения сверьте логи: хиты McontextualBot должны уйти в блок, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Сайт не монетизируется через программатик-рекламу — Disallow в robots.txt обычно достаточно, оператор подтверждает его соблюдение;
  • Сайт зарабатывает на рекламе и заинтересован в контекстном таргетинге — рассмотрите allow как осознанное решение;
  • Нагрузка заметна несмотря на Disallow — переходите к серверной блокировке;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит рассмотреть перенос McontextualBot из «Прочие краулеры и сервисы» в «Рекламные и AdTech-боты» — рядом с уже размеченными в базе GroovinaAdsbot и BrandVerity. Оператор сам открыто заявляет рекламную цель обхода, и это не требует предположений или косвенных признаков, в отличие от многих других записей в текущей категории.

Бот / сосед Кластер Комментарий
ContextualBot Прочие краулеры и сервисы (см. отдельную статью) Другая компания (вероятно Mobian) с похожим названием и той же контекстной AdTech-функцией — не путать друг с другом
GroovinaAdsbot Рекламные и AdTech-боты Похожий профиль ad-verification/targeting краулера
BrandVerity Рекламные и AdTech-боты нежелательный, тоже brand safety/ad-verification направление
AudigentAdBot Рекламные и AdTech-боты нежелательный

9. Стратегия allow/deny для McontextualBot

Ситуация Действие
Сайт не монетизируется через программатик-рекламу Disallow в robots.txt — оператор подтверждает соблюдение
Сайт зарабатывает на рекламе, заинтересован в контекстном таргетинге Allow, уточнив у команды монетизации
Нагрузка сохраняется вопреки Disallow Серверная блокировка как следующий шаг
Подозрение на spoofing UA Не полагаться на принадлежность IP AWS/GCP — сверять полную строку UA и характер обхода

Частые вопросы

McontextualBot — это анонимный сборщик данных?

Нет, оператор MContextual сам открыто указывает на своей странице, что бот собирает содержимое сайтов для контекстной рекламы.

Работает ли блокировка через robots.txt против этого бота?

Да, сам оператор подтверждает, что стандартные директивы robots.txt эффективно останавливают обход.

Почему сверка IP-адреса здесь не самый надёжный способ проверки?

Потому что бот работает с общедоступной облачной инфраструктуры AWS и GCP, а не с выделенного корпоративного диапазона.

Есть ли прямая польза для владельца сайта от этого краулера?

Как правило нет, если только сайт сам не монетизируется через контекстную программатик-рекламу и не заинтересован в таком таргетинге.

Это тот же бот, что и ContextualBot?

Нет, это другая компания с похожим названием — не стоит путать McontextualBot (MContextual) и ContextualBot (вероятно Mobian).

Стоит ли пересмотреть категорию этого бота в базе TrafficVeil?

Да, поскольку рекламная цель подтверждена официально, логичнее разместить его среди AdTech-ботов, а не в общей категории «прочие сервисы».

#McontextualBot#MContextual#AdTech-боты#контекстная реклама#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.