MJ12bot отличается от большинства конкурентов архитектурно: вместо единого централизованного краулера Majestic исторически использовала распределённую сеть — десятки тысяч отдельных машин, выполняющих обход параллельно. Это сделало MJ12bot одной из самых масштабных краулинговых операций в интернете, но одновременно привело к репутации одного из наиболее агрессивных и сложных для верификации SEO-ботов.
1. Что такое MJ12bot
1.1 User-Agent строка
# Текущая версия:
Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)
# Номер версии регулярно меняется при обновлениях бота —
# ориентируйтесь на ключевое слово MJ12bot, а не точную версию
1.2 Кто стоит за MJ12bot
| Параметр | Значение |
|---|---|
| Оператор | Majestic (Великобритания) |
| Год запуска | 2004 — один из старейших активных SEO-краулеров |
| Основной продукт | Backlink-индекс, Trust Flow, Citation Flow |
| Архитектура | Распределённая сеть (десятки тысяч отдельных машин) |
| Фокус | Преимущественно ссылки, в меньшей степени — контент страниц |
| Уровень агрессивности | Умеренно высокий — один из самых заметных по нагрузке SEO-краулеров |
1.3 Trust Flow и Citation Flow — что строит MJ12bot
| Метрика | Что измеряет |
|---|---|
| Citation Flow (CF) | Количественная сила ссылочного профиля — сколько всего ссылок ведёт на домен/страницу |
| Trust Flow (TF) | Качественная оценка — насколько надёжны источники, ссылающиеся на домен |
| Соотношение TF/CF | Используется SEO-специалистами как индикатор естественности ссылочного профиля: большой разрыв между CF и TF часто говорит о спамных или низкокачественных ссылках |
Обе метрики рассчитываются исключительно на основе данных, которые непрерывно собирает MJ12bot, обходя страницы и фиксируя структуру ссылок между ними.
1.4 Распределённая архитектура — источник проблем с верификацией
В отличие от Google или большинства SEO-краулеров, использующих централизованную инфраструктуру с предсказуемыми диапазонами IP, классический MJ12bot работает как распределённая сеть. Это исторически создавало серьёзную проблему для администраторов сайтов: бот не поддаётся простой верификации через обратный DNS так же надёжно, как Googlebot или Bingbot — у каждой отдельной машины в сети может не быть единообразной обратной DNS-записи.
1.5 Важное изменение 2025–2026: новый централизованный краулер v2
Согласно официальному блогу Majestic, в течение 2025 года компания вела разработку второго, централизованного краулера, дополняющего историческую распределённую сеть. Внимательные администраторы логов уже могут замечать записи от «v2 MJ12bot». Это не замена существующего бота, а параллельная инфраструктура — оба краулера продолжат работать совместно, разделяя значительную часть кода и инфраструктуры.
| Параметр | Классический MJ12bot (распределённый) | Новый централизованный краулер (v2) |
|---|---|---|
| Архитектура | Десятки тысяч отдельных машин | Централизованная инфраструктура |
| Верификация через reverse DNS | Затруднена | Будет поддерживать полноценную верификацию |
| Совместимость с правилами robots.txt для MJ12bot | Полная | Будет следовать всем правилам, адресованным MJ12bot, как минимум в течение 12 месяцев после финального релиза |
| Отдельное управление через robots.txt | — | Запланирована возможность настраивать правила отдельно через новый User-Agent токен |
| Статус на 2026 год | Полностью в эксплуатации | Финальная стадия бета-тестирования |
Главный практический вывод для вебмастеров: по заявлению Majestic — паниковать не нужно. Новый краулер будет уважать существующие правила, адресованные MJ12bot, как минимум на протяжении года после официального релиза. Детали нового User-Agent токена (включая RFC 9309 product token) будут опубликованы на отдельном микросайте — продвинутые пользователи впоследствии получат возможность настраивать правила для обоих краулеров раздельно.
2. Как работает MJ12bot
2.1 Этапы обхода
- MJ12bot систематически обходит публичные страницы интернета, переходя по обнаруженным ссылкам.
- На каждой странице фиксируются все исходящие и входящие гиперссылки.
- Данные о связях между страницами агрегируются в граф ссылок Majestic.
- На основе накопленного графа рассчитываются метрики Trust Flow и Citation Flow для каждого домена и URL.
- Обновлённые данные становятся доступны в инструментах Majestic (Site Explorer, Majestic Million и др.).
2.2 Что MJ12bot анализирует
| Элемент | Что извлекается | Важность |
|---|---|---|
| Исходящие и входящие ссылки | Построение глобального графа ссылок | ⭐⭐⭐⭐⭐ Главная и практически единственная задача |
| Анкорный текст ссылок | Контекст ссылочной массы | ⭐⭐⭐⭐ Очень важно |
| Атрибуты ссылок (rel) | nofollow, sponsored, ugc — фильтрация для метрик | ⭐⭐⭐⭐ Очень важно |
| HTTP-статусы и редиректы | Техническое здоровье ссылок в индексе | ⭐⭐⭐ Важно |
| Текстовый контент страницы | Вторично — Majestic специализируется именно на ссылках, а не контенте | ⭐⭐ Умеренно |
Ключевая особенность специализации: в отличие от Ahrefs или Semrush, которые наряду со ссылками глубоко анализируют контент, технические SEO-параметры и позиции в выдаче, MJ12bot сфокусирован практически исключительно на обнаружении и анализе ссылок. Разрешение или блокировка этого бота в первую очередь влияет на точность данных о вашем сайте именно в инструментах ссылочного анализа Majestic, а не на широкий спектр SEO-метрик.
3. Нагрузка на сервер
3.1 Репутация одного из самых агрессивных SEO-краулеров
MJ12bot регулярно упоминается в индустрии как один из наиболее ресурсоёмких легитимных SEO-краулеров. Распределённая архитектура с десятками тысяч машин означает, что при отсутствии ограничений бот способен генерировать заметно более высокую нагрузку, чем централизованные краулеры конкурентов.
3.2 Контекст из реальных данных pbnshield
По статистике pbnshield за март–май 2026 года, MJ12Bot занял 22-е место среди 100 зафиксированных ботов с долей 0.6% (659 174 запроса), показав резкий рост в течение квартала:
| Месяц | Запросов MJ12Bot | Динамика |
|---|---|---|
| Март 2026 | 22 120 | — |
| Апрель 2026 | 110 235 | 📈 рост ×5 |
| Май 2026 | 526 819 | 📈 рост ×4.8 |
Совокупный рост за квартал составил почти ×24 — один из самых быстрорастущих SEO-краулеров в выборке наряду с SemrushBot, что может отражать общую тенденцию активизации SEO-аналитических инструментов в этот период.
3.3 Поддержка Crawl-delay
MJ12bot официально уважает директиву Crawl-delay в robots.txt — это эффективный и официально подтверждённый способ снизить нагрузку без полной блокировки:
# Базовое ограничение:
User-agent: MJ12bot
Crawl-delay: 10
# Многие сайты с высокой нагрузкой выбирают компромиссный подход —
# разрешают бот, но устанавливают агрессивную задержку:
User-agent: MJ12bot
Crawl-delay: 60
На практике многие сайты с заметной нагрузкой выбирают именно такой компромисс: разрешить MJ12bot для сохранения точности данных в Trust Flow / Citation Flow, но установить задержку в диапазоне 30–60 секунд, балансируя между индексацией ссылок и нагрузкой на сервер. Рекомендуется отслеживать реальное влияние бота через логи и корректировать значение по результатам.
4. Обнаружение в логах
4.1 Как выглядит запись
# Стандартный запрос MJ12bot:
46.235.224.10 - - [09/May/2026:14:05:11 +0000] \
"GET /blog/link-building-guide/ HTTP/1.1" \
200 28432 "-" \
"Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)"
# Запись от нового централизованного краулера (v2), 2026:
46.235.224.55 - - [09/May/2026:14:06:00 +0000] \
"GET /catalog/product/ HTTP/1.1" \
200 18432 "-" \
"Mozilla/5.0 (compatible; MJ12bot-v2/2.0; http://mj12bot.com/)"
# Точный токен v2 будет опубликован Majestic на отдельном микросайте —
# приведённый пример отражает ожидаемый формат, уточняйте актуальную строку
4.2 Аналитика через grep
Найти все запросы MJ12bot:
grep -i 'mj12bot' /var/log/apache2/access.log
Подсчитать количество запросов за сегодня:
grep -i 'mj12bot' access.log | grep "$(date +%d/%b/%Y)" | wc -l
Топ обходимых страниц:
grep -i 'mj12bot' access.log \
| awk '{print $7}' | sort | uniq -c | sort -rn | head -20
Bandwidth, потребляемый ботом (приблизительно):
grep -i 'mj12bot' access.log \
| awk '{sum += $10} END {print sum/1024/1024 " MB"}'
HTTP-коды ответов:
grep -i 'mj12bot' access.log \
| awk '{print $9}' | sort | uniq -c | sort -nr
Активность по часам — выявление пиков нагрузки:
grep -i 'mj12bot' access.log \
| awk '{print $4}' | cut -d: -f2 | sort | uniq -c | sort -n
Live-мониторинг:
tail -f /var/log/apache2/access.log | grep --line-buffered -i 'mj12bot'
4.3 Верификация подлинности
⚠ Важная особенность: в отличие от большинства крупных краулеров, классический распределённый MJ12bot исторически не поддаётся надёжной верификации через простой обратный DNS lookup — именно эта особенность стала одним из главных стимулов для разработки нового централизованного краулера v2.
#!/bin/bash
# Попытка верификации (ограниченная эффективность для классического MJ12bot):
IP=$1
HOST=$(host $IP | awk '{print $NF}')
if [[ $HOST == *mj12bot.com* ]]; then
FWD=$(host $HOST | awk '{print $NF}')
if [[ $FWD == $IP ]]; then
echo "✔ Подтверждено через DNS: $IP → $HOST"
else
echo "✖ DNS mismatch: $IP"
fi
else
echo "⚠ Нет подтверждающей PTR-записи — типично для распределённой сети MJ12bot.
Это не всегда означает подделку, но требует дополнительной осторожности."
fi
Практическая рекомендация: поскольку надёжная DNS-верификация классического MJ12bot затруднена, для критичных решений (например, выдачи разного контента в зависимости от бота) полагайтесь на комбинацию факторов: паттерн поведения (систематический обход ссылок, а не хаотичные запросы), отсутствие признаков вредоносной активности, и при необходимости — обращение в официальную поддержку Majestic через mj12bot.com.
5. Управление MJ12bot
5.1 Полная блокировка через robots.txt
User-agent: MJ12bot
Disallow: /
Последствие: блокировка не повлияет на позиции сайта в Google, Bing или Яндексе — MJ12bot не передаёт данные в поисковые алгоритмы. Эффект ограничивается исключительно точностью данных о вашем сайте в инструментах Majestic (Trust Flow, Citation Flow, Site Explorer).
5.2 Рекомендуемый компромисс — Crawl-delay вместо блокировки
User-agent: MJ12bot
Crawl-delay: 30
Disallow: /admin/
Disallow: /private/
Disallow: /staging/
Disallow: /api/
Allow: /blog/
Allow: /
5.3 Ограничение по времени суток (off-peak crawling)
Для сайтов, где нагрузка от MJ12bot заметна в часы пиковой пользовательской активности, можно настроить разрешение обхода только в непиковые часы на уровне сервера:
# Nginx — пример ограничения через geo/map в комбинации с условием времени
# (требует дополнительной логики на уровне приложения или специализированных модулей,
# так как чистый Nginx не поддерживает условия по времени из коробки) —
# альтернатива: настройка через внешний скрипт-обёртку или WAF-правило по расписанию.
5.4 Rate limiting через Nginx
# Ограничить MJ12bot до 60 запросов в минуту:
limit_req_zone $http_user_agent zone=mj12:10m rate=60r/m;
map $http_user_agent $limit_mj12 {
default 0;
"~*MJ12bot" 1;
}
location / {
if ($limit_mj12) {
limit_req zone=mj12 burst=10;
}
}
5.5 Блокировка через .htaccess (Apache)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} MJ12bot [NC]
RewriteRule .* - [F,L]
5.6 Подготовка к новому краулеру v2
Учитывая, что новый централизованный краулер находится на финальной стадии бета-тестирования, рекомендуется:
- Периодически проверять блог Majestic (blog.majestic.com) и микросайт с деталями нового User-Agent на предмет официального релиза
- Не предпринимать срочных действий — по заявлению Majestic, новый краулер будет уважать существующие правила для MJ12bot минимум 12 месяцев после релиза
- После публикации точного токена нового User-Agent — рассмотреть, нужно ли настраивать для него отдельные правила (например, если хотите получить преимущества улучшенной верификации, но управлять обоими краулерами по-разному)
6. Диагностика проблем
6.1 Типичные проблемы и решения
| Проблема | Причина | Решение |
|---|---|---|
| MJ12bot создаёт заметную нагрузку | Распределённая архитектура, отсутствие Crawl-delay | Установить Crawl-delay 30–60 секунд |
| Не получается верифицировать IP через DNS | Особенность распределённой сети — нет единообразных PTR-записей | Дождаться перехода на v2 или оценивать по паттерну поведения |
| Данные Trust Flow/Citation Flow устарели | Бот заблокирован полностью | Проверить robots.txt, рассмотреть Crawl-delay вместо Disallow |
| Появились записи с незнакомым User-Agent похожим на MJ12bot | Вероятно, новый централизованный краулер v2 на стадии бета | Дождаться официальной публикации токена, временно не блокировать без необходимости |
| Подозрение на подделку User-Agent | Из-за сложности верификации MJ12bot — частая цель для маскировки | Анализировать паттерн поведения, обращаться в поддержку Majestic при сомнениях |
6.2 Пошаговая диагностика
Шаг 1 — Проверить robots.txt:
curl https://example.com/robots.txt | grep -i 'mj12bot'
Шаг 2 — Проверить доступность сайта для бота:
curl -A "Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)" \
-I https://example.com/
# Ожидается: HTTP/1.1 200 OK
Шаг 3 — Оценить реальное влияние на сервер:
# Сравнить долю MJ12bot в общем трафике:
echo "Всего запросов:"
wc -l access.log
echo "Запросов от MJ12bot:"
grep -ci 'mj12bot' access.log
Шаг 4 — При сомнениях в легитимности — обратиться в Majestic:
# Официальный сайт с FAQ и контактами:
https://mj12bot.com/
7. MJ12bot vs другие крупные ссылочные краулеры
| Краулер | Компания | Год запуска | Архитектура | Фокус | Crawl-delay |
|---|---|---|---|---|---|
| MJ12bot | Majestic | 2004 | Распределённая (+ новая централизованная v2) | Преимущественно ссылки | ✔ Поддерживает |
| AhrefsBot | Ahrefs | 2010-е | Централизованная | Ссылки + контент | ✔ Поддерживает (до 30 сек) |
| SemrushBot | Semrush | 2008 | Централизованная, семейство ботов | Ссылки, аудит, контент, позиции | ✔ Поддерживает (до 10 сек) |
| DotBot (Moz) | Moz | 2000-е | Централизованная | Domain Authority, ссылки | ✔ Поддерживает |
Контекст из реальных данных: по статистике pbnshield за тот же период, AhrefsBot занял позицию заметно ниже MJ12bot (около 0.3% против 0.6%), а SemrushBot — выше (1.3%). Несмотря на свой возраст, MJ12bot остаётся весомым игроком в этой категории, особенно с учётом его взрывного роста в исследуемый период.
8. Рекомендуемая стратегия
✔ Главный принцип: MJ12bot — легитимный, но заметно более ресурсоёмкий краулер по сравнению с большинством SEO-ботов. Используйте Crawl-delay как основной инструмент баланса между точностью данных Majestic и нагрузкой на сервер, прежде чем переходить к полной блокировке.
| Задача | Решение |
|---|---|
| Снизить нагрузку, сохранив данные в Majestic | Crawl-delay: 30 — 60 в зависимости от ситуации |
| Полностью исключить сайт из индекса Majestic | User-agent: MJ12bot / Disallow: / |
| Защитить чувствительные разделы | Точечный Disallow для /admin/, /private/, /staging/, /api/ |
| Оценить реальное влияние на сервер | grep + расчёт доли от общего трафика |
| Подготовиться к переходу на v2 | Следить за blog.majestic.com, не паниковать заранее |
| Снизить нагрузку через rate limiting | Nginx limit_req_zone по User-Agent |
| Оценить легитимность подозрительного трафика | Анализ паттерна поведения + обращение в поддержку Majestic |