Боты6 мин чтения·11 августа 2026 г.

MarketMuse: не AI-краулер для обучения моделей, а платформа контент-стратегии с 2013 года

MarketMuse — известная на рынке SEO и контент-стратегии платформа (с 2024 года — часть Siteimprove), встраивавшая ИИ в свои продукты ещё до того, как термин «AI-краулер» вошёл в обиход. Разбираем, зачем построению моделей тем нужен обход сотен-тысяч сторонних страниц, чем это отличается от накопления обучающего датасета для генеративной модели, и когда бот работает в интересах самого сайта.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота MarketMuse: легитимный ai и llm-краулеры

MarketMuse — не безымянный «AI и LLM-краулер», а известная на рынке контент-стратегии платформа, встраивающая ИИ в свои продукты с момента основания в 2013 году, — задолго до того, как термин «AI-краулер» вообще вошёл в обиход. В октябре 2024 года компанию приобрела Siteimprove, включив её возможности контент-аналитики в более широкий пакет продуктов для аналитики, доступности и SEO.

Что делает платформа и зачем ей нужен веб-краулинг

MarketMuse строит модели тем (topic modeling) на основе анализа огромного массива контента: по независимому обзору TechRadar, для каждой анализируемой страницы или темы платформа подтягивает от сотен до тысяч страниц веб-контента, отфильтровывает низкокачественные выбросы и применяет комбинацию собственных и открытых алгоритмов для классификации частей речи и оценки релевантности. Отдельная функция — автоматическая инвентаризация контента: после подключения домена клиента AI-модуль MarketMuse обходит уже опубликованные страницы этого сайта и картирует существующий охват тем, выявляя, по каким предметам сайт уже занимает сильные позиции, а где конкуренты имеют преимущество, — причём этот инвентарь обновляется автоматически со временем, снимая необходимость в ручных контент-аудитах.

Параметры бота

Параметр Значение
User-Agent / паттерн marketmuse
Оператор MarketMuse (по состоянию с октября 2024 — часть Siteimprove)
Основана 2013 год, соучредители Аки Балог и Джефф Койл
Назначение Построение модели тем: анализ содержимого сотен-тысяч сторонних страниц для оценки релевантности + автоматический инвентарь и картирование собственного контента клиентов платформы
Целевая аудитория продукта SEO-специалисты, контент-стратеги, редакторы, издатели и агентства, работающие с построением тематического авторитета сайтов
Официальная документация краулера ❌ Отдельной публичной страницы про политику именно веб-краулера не найдено — есть общая база знаний по продукту (docs.marketmuse.com)
Список IP-адресов ❌ Отсутствует

Почему шаблонная классификация вводит в заблуждение

Формулировка «сырьё для AI-пайплайна оператора» предполагает, что цель — накопление обучающего датасета для генеративной модели. Реальная бизнес-модель MarketMuse другая и куда более старая: платформа продаёт SEO- и контент-командам доступ к анализу тематического ландшафта — какие темы уже хорошо закрыты контентом (в том числе у конкурентов), где есть пробелы, и как выстроить контент-план, чтобы обойти соперников в конкретной нише. Обход сторонних сайтов здесь — не сбор сырья для обучения языковой модели общего назначения, а исследовательская функция внутри конкретного, оплачиваемого клиентами B2B-продукта контент-аналитики, работающего в этой нише уже более десяти лет.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

# Базовый поиск
grep -i "marketmuse" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "marketmuse" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois — как и с большинством ботов без опубликованного фида.

Стоит ли блокировать

  • если сайт сам является клиентом MarketMuse (или планирует им стать) — обход нужен для работы функции автоматической инвентаризации собственного контента, и блокировка ломает эту функцию для собственной же команды;
  • если сайт выступает в роли стороннего источника, который платформа анализирует в рамках построения модели тем для чужого клиента (например, как конкурент по определённой нише), — присутствие в этом анализе не приносит прямой выгоды владельцу сайта, но и не является массовым скрапингом для перепродажи текста как такового: используется структурная и тематическая информация, а не публикация исходного контента;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это отдельный от классической поисковой индексации продукт контент-аналитики.

Как заблокировать или разрешить

Явное разрешение для клиентов платформы, которым нужна работа автоинвентаризации собственного сайта:

User-agent: marketmuse
Allow: /

Стандартный запрет для сайтов, не заинтересованных в подобном анализе:

User-agent: marketmuse
Disallow: /
if ($http_user_agent ~* "marketmuse") {
    return 403;
}

Если полный запрет избыточен, а беспокоит лишь заметный объём запросов при анализе «сотен-тысяч страниц» по описанной выше модели работы платформы, разумная альтернатива — ограничение частоты:

limit_req_zone $binary_remote_addr zone=marketmuse:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "marketmuse") {
        limit_req zone=marketmuse burst=20 nodelay;
    }
}

Частые вопросы

MarketMuse собирает данные для обучения AI-моделей общего назначения?
Нет, это давняя (с 2013 года) B2B-платформа контент-стратегии — обход сайтов служит построению моделей тем для конкретного продукта, а не накоплению обучающего датасета.
Кто сейчас владеет MarketMuse?
С октября 2024 года платформа — часть Siteimprove, объединившей её возможности с более широким пакетом продуктов аналитики и SEO.
Зачем боту обходить сотни-тысячи сторонних страниц?
Чтобы построить модель темы: отфильтровать низкокачественный контент и оценить релевантность через собственные и открытые алгоритмы классификации текста.
Может ли бот работать в интересах самого сайта?
Да, если сайт — клиент платформы: функция автоматической инвентаризации контента обходит уже опубликованные страницы клиента, чтобы картировать его тематический охват.
Стоит ли блокировать бота, если сайт не пользуется MarketMuse?
Прямой выгоды в этом случае нет, но и полноценного скрапинга текста как такового тоже — используется структурная и тематическая информация, а не публикация исходного контента.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, это отдельный от классической поисковой индексации продукт контент-аналитики.
#marketmuse#Siteimprove#content intelligence#topic modeling#бот-энциклопедия#robots.txt#SEO-платформа#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil