MarketMuse — не безымянный «AI и LLM-краулер», а известная на рынке контент-стратегии платформа, встраивающая ИИ в свои продукты с момента основания в 2013 году, — задолго до того, как термин «AI-краулер» вообще вошёл в обиход. В октябре 2024 года компанию приобрела Siteimprove, включив её возможности контент-аналитики в более широкий пакет продуктов для аналитики, доступности и SEO.
Что делает платформа и зачем ей нужен веб-краулинг
MarketMuse строит модели тем (topic modeling) на основе анализа огромного массива контента: по независимому обзору TechRadar, для каждой анализируемой страницы или темы платформа подтягивает от сотен до тысяч страниц веб-контента, отфильтровывает низкокачественные выбросы и применяет комбинацию собственных и открытых алгоритмов для классификации частей речи и оценки релевантности. Отдельная функция — автоматическая инвентаризация контента: после подключения домена клиента AI-модуль MarketMuse обходит уже опубликованные страницы этого сайта и картирует существующий охват тем, выявляя, по каким предметам сайт уже занимает сильные позиции, а где конкуренты имеют преимущество, — причём этот инвентарь обновляется автоматически со временем, снимая необходимость в ручных контент-аудитах.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | marketmuse |
| Оператор | MarketMuse (по состоянию с октября 2024 — часть Siteimprove) |
| Основана | 2013 год, соучредители Аки Балог и Джефф Койл |
| Назначение | Построение модели тем: анализ содержимого сотен-тысяч сторонних страниц для оценки релевантности + автоматический инвентарь и картирование собственного контента клиентов платформы |
| Целевая аудитория продукта | SEO-специалисты, контент-стратеги, редакторы, издатели и агентства, работающие с построением тематического авторитета сайтов |
| Официальная документация краулера | ❌ Отдельной публичной страницы про политику именно веб-краулера не найдено — есть общая база знаний по продукту (docs.marketmuse.com) |
| Список IP-адресов | ❌ Отсутствует |
Почему шаблонная классификация вводит в заблуждение
Формулировка «сырьё для AI-пайплайна оператора» предполагает, что цель — накопление обучающего датасета для генеративной модели. Реальная бизнес-модель MarketMuse другая и куда более старая: платформа продаёт SEO- и контент-командам доступ к анализу тематического ландшафта — какие темы уже хорошо закрыты контентом (в том числе у конкурентов), где есть пробелы, и как выстроить контент-план, чтобы обойти соперников в конкретной нише. Обход сторонних сайтов здесь — не сбор сырья для обучения языковой модели общего назначения, а исследовательская функция внутри конкретного, оплачиваемого клиентами B2B-продукта контент-аналитики, работающего в этой нише уже более десяти лет.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "marketmuse" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "marketmuse" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois — как и с большинством ботов без опубликованного фида.
Стоит ли блокировать
- если сайт сам является клиентом MarketMuse (или планирует им стать) — обход нужен для работы функции автоматической инвентаризации собственного контента, и блокировка ломает эту функцию для собственной же команды;
- если сайт выступает в роли стороннего источника, который платформа анализирует в рамках построения модели тем для чужого клиента (например, как конкурент по определённой нише), — присутствие в этом анализе не приносит прямой выгоды владельцу сайта, но и не является массовым скрапингом для перепродажи текста как такового: используется структурная и тематическая информация, а не публикация исходного контента;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это отдельный от классической поисковой индексации продукт контент-аналитики.
Как заблокировать или разрешить
Явное разрешение для клиентов платформы, которым нужна работа автоинвентаризации собственного сайта:
User-agent: marketmuse
Allow: /
Стандартный запрет для сайтов, не заинтересованных в подобном анализе:
User-agent: marketmuse
Disallow: /
if ($http_user_agent ~* "marketmuse") {
return 403;
}
Если полный запрет избыточен, а беспокоит лишь заметный объём запросов при анализе «сотен-тысяч страниц» по описанной выше модели работы платформы, разумная альтернатива — ограничение частоты:
limit_req_zone $binary_remote_addr zone=marketmuse:10m rate=10r/m;
location / {
if ($http_user_agent ~* "marketmuse") {
limit_req zone=marketmuse burst=20 nodelay;
}
}Частые вопросы
MarketMuse собирает данные для обучения AI-моделей общего назначения?
Кто сейчас владеет MarketMuse?
Зачем боту обходить сотни-тысячи сторонних страниц?
Может ли бот работать в интересах самого сайта?
Стоит ли блокировать бота, если сайт не пользуется MarketMuse?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.