TrafficVeil
Боты 3 мин24 июня 2026 г.

MJ12bot — веб-краулер компании Majestic

MJ12bot — веб-краулер компании Majestic, британской SEO-компании, специализирующейся на анализе обратных ссылок и построении одного из крупнейших коммерческих индексов ссылок в мире. Бот работает с 2004 года — это один из старейших действующих SEO-краулеров в индустрии, питающий фирменные метрики Majestic: Trust Flow и Citation Flow, которые широко используются SEO-специалистами для оценки авторитетности доменов и качества ссылочной массы.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое MJ12bot
  2. 1.1 User-Agent строка
  3. 1.2 Кто стоит за MJ12bot
  4. 1.3 Trust Flow и Citation Flow — что строит MJ12bot
  5. 1.4 Распределённая архитектура — источник проблем с верификацией
  6. 1.5 Важное изменение 2025–2026: новый централизованный краулер v2
  7. 2. Как работает MJ12bot
  8. 2.1 Этапы обхода
  9. 2.2 Что MJ12bot анализирует
  10. 3. Нагрузка на сервер
  11. 3.1 Репутация одного из самых агрессивных SEO-краулеров
  12. 3.2 Контекст из реальных данных pbnshield
  13. 3.3 Поддержка Crawl-delay
  14. 4. Обнаружение в логах
  15. 4.1 Как выглядит запись
  16. 4.2 Аналитика через grep
  17. 4.3 Верификация подлинности
  18. 5. Управление MJ12bot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

MJ12bot отличается от большинства конкурентов архитектурно: вместо единого централизованного краулера Majestic исторически использовала распределённую сеть — десятки тысяч отдельных машин, выполняющих обход параллельно. Это сделало MJ12bot одной из самых масштабных краулинговых операций в интернете, но одновременно привело к репутации одного из наиболее агрессивных и сложных для верификации SEO-ботов.

1. Что такое MJ12bot

1.1 User-Agent строка

# Текущая версия:
Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)

# Номер версии регулярно меняется при обновлениях бота —
# ориентируйтесь на ключевое слово MJ12bot, а не точную версию

1.2 Кто стоит за MJ12bot

Параметр Значение
Оператор Majestic (Великобритания)
Год запуска 2004 — один из старейших активных SEO-краулеров
Основной продукт Backlink-индекс, Trust Flow, Citation Flow
Архитектура Распределённая сеть (десятки тысяч отдельных машин)
Фокус Преимущественно ссылки, в меньшей степени — контент страниц
Уровень агрессивности Умеренно высокий — один из самых заметных по нагрузке SEO-краулеров

1.3 Trust Flow и Citation Flow — что строит MJ12bot

Метрика Что измеряет
Citation Flow (CF) Количественная сила ссылочного профиля — сколько всего ссылок ведёт на домен/страницу
Trust Flow (TF) Качественная оценка — насколько надёжны источники, ссылающиеся на домен
Соотношение TF/CF Используется SEO-специалистами как индикатор естественности ссылочного профиля: большой разрыв между CF и TF часто говорит о спамных или низкокачественных ссылках

Обе метрики рассчитываются исключительно на основе данных, которые непрерывно собирает MJ12bot, обходя страницы и фиксируя структуру ссылок между ними.

1.4 Распределённая архитектура — источник проблем с верификацией

В отличие от Google или большинства SEO-краулеров, использующих централизованную инфраструктуру с предсказуемыми диапазонами IP, классический MJ12bot работает как распределённая сеть. Это исторически создавало серьёзную проблему для администраторов сайтов: бот не поддаётся простой верификации через обратный DNS так же надёжно, как Googlebot или Bingbot — у каждой отдельной машины в сети может не быть единообразной обратной DNS-записи.

1.5 Важное изменение 2025–2026: новый централизованный краулер v2

Согласно официальному блогу Majestic, в течение 2025 года компания вела разработку второго, централизованного краулера, дополняющего историческую распределённую сеть. Внимательные администраторы логов уже могут замечать записи от «v2 MJ12bot». Это не замена существующего бота, а параллельная инфраструктура — оба краулера продолжат работать совместно, разделяя значительную часть кода и инфраструктуры.

Параметр Классический MJ12bot (распределённый) Новый централизованный краулер (v2)
Архитектура Десятки тысяч отдельных машин Централизованная инфраструктура
Верификация через reverse DNS Затруднена Будет поддерживать полноценную верификацию
Совместимость с правилами robots.txt для MJ12bot Полная Будет следовать всем правилам, адресованным MJ12bot, как минимум в течение 12 месяцев после финального релиза
Отдельное управление через robots.txt Запланирована возможность настраивать правила отдельно через новый User-Agent токен
Статус на 2026 год Полностью в эксплуатации Финальная стадия бета-тестирования

Главный практический вывод для вебмастеров: по заявлению Majestic — паниковать не нужно. Новый краулер будет уважать существующие правила, адресованные MJ12bot, как минимум на протяжении года после официального релиза. Детали нового User-Agent токена (включая RFC 9309 product token) будут опубликованы на отдельном микросайте — продвинутые пользователи впоследствии получат возможность настраивать правила для обоих краулеров раздельно.

2. Как работает MJ12bot

2.1 Этапы обхода

  1. MJ12bot систематически обходит публичные страницы интернета, переходя по обнаруженным ссылкам.
  2. На каждой странице фиксируются все исходящие и входящие гиперссылки.
  3. Данные о связях между страницами агрегируются в граф ссылок Majestic.
  4. На основе накопленного графа рассчитываются метрики Trust Flow и Citation Flow для каждого домена и URL.
  5. Обновлённые данные становятся доступны в инструментах Majestic (Site Explorer, Majestic Million и др.).

2.2 Что MJ12bot анализирует

Элемент Что извлекается Важность
Исходящие и входящие ссылки Построение глобального графа ссылок ⭐⭐⭐⭐⭐ Главная и практически единственная задача
Анкорный текст ссылок Контекст ссылочной массы ⭐⭐⭐⭐ Очень важно
Атрибуты ссылок (rel) nofollow, sponsored, ugc — фильтрация для метрик ⭐⭐⭐⭐ Очень важно
HTTP-статусы и редиректы Техническое здоровье ссылок в индексе ⭐⭐⭐ Важно
Текстовый контент страницы Вторично — Majestic специализируется именно на ссылках, а не контенте ⭐⭐ Умеренно

Ключевая особенность специализации: в отличие от Ahrefs или Semrush, которые наряду со ссылками глубоко анализируют контент, технические SEO-параметры и позиции в выдаче, MJ12bot сфокусирован практически исключительно на обнаружении и анализе ссылок. Разрешение или блокировка этого бота в первую очередь влияет на точность данных о вашем сайте именно в инструментах ссылочного анализа Majestic, а не на широкий спектр SEO-метрик.

3. Нагрузка на сервер

3.1 Репутация одного из самых агрессивных SEO-краулеров

MJ12bot регулярно упоминается в индустрии как один из наиболее ресурсоёмких легитимных SEO-краулеров. Распределённая архитектура с десятками тысяч машин означает, что при отсутствии ограничений бот способен генерировать заметно более высокую нагрузку, чем централизованные краулеры конкурентов.

3.2 Контекст из реальных данных pbnshield

По статистике pbnshield за март–май 2026 года, MJ12Bot занял 22-е место среди 100 зафиксированных ботов с долей 0.6% (659 174 запроса), показав резкий рост в течение квартала:

Месяц Запросов MJ12Bot Динамика
Март 2026 22 120
Апрель 2026 110 235 📈 рост ×5
Май 2026 526 819 📈 рост ×4.8

Совокупный рост за квартал составил почти ×24 — один из самых быстрорастущих SEO-краулеров в выборке наряду с SemrushBot, что может отражать общую тенденцию активизации SEO-аналитических инструментов в этот период.

3.3 Поддержка Crawl-delay

MJ12bot официально уважает директиву Crawl-delay в robots.txt — это эффективный и официально подтверждённый способ снизить нагрузку без полной блокировки:

# Базовое ограничение:
User-agent: MJ12bot
Crawl-delay: 10

# Многие сайты с высокой нагрузкой выбирают компромиссный подход —
# разрешают бот, но устанавливают агрессивную задержку:
User-agent: MJ12bot
Crawl-delay: 60

На практике многие сайты с заметной нагрузкой выбирают именно такой компромисс: разрешить MJ12bot для сохранения точности данных в Trust Flow / Citation Flow, но установить задержку в диапазоне 30–60 секунд, балансируя между индексацией ссылок и нагрузкой на сервер. Рекомендуется отслеживать реальное влияние бота через логи и корректировать значение по результатам.

4. Обнаружение в логах

4.1 Как выглядит запись

# Стандартный запрос MJ12bot:
46.235.224.10 - - [09/May/2026:14:05:11 +0000] \
  "GET /blog/link-building-guide/ HTTP/1.1" \
  200 28432 "-" \
  "Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)"

# Запись от нового централизованного краулера (v2), 2026:
46.235.224.55 - - [09/May/2026:14:06:00 +0000] \
  "GET /catalog/product/ HTTP/1.1" \
  200 18432 "-" \
  "Mozilla/5.0 (compatible; MJ12bot-v2/2.0; http://mj12bot.com/)"
# Точный токен v2 будет опубликован Majestic на отдельном микросайте —
# приведённый пример отражает ожидаемый формат, уточняйте актуальную строку

4.2 Аналитика через grep

Найти все запросы MJ12bot:

grep -i 'mj12bot' /var/log/apache2/access.log

Подсчитать количество запросов за сегодня:

grep -i 'mj12bot' access.log | grep "$(date +%d/%b/%Y)" | wc -l

Топ обходимых страниц:

grep -i 'mj12bot' access.log \
  | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Bandwidth, потребляемый ботом (приблизительно):

grep -i 'mj12bot' access.log \
  | awk '{sum += $10} END {print sum/1024/1024 " MB"}'

HTTP-коды ответов:

grep -i 'mj12bot' access.log \
  | awk '{print $9}' | sort | uniq -c | sort -nr

Активность по часам — выявление пиков нагрузки:

grep -i 'mj12bot' access.log \
  | awk '{print $4}' | cut -d: -f2 | sort | uniq -c | sort -n

Live-мониторинг:

tail -f /var/log/apache2/access.log | grep --line-buffered -i 'mj12bot'

4.3 Верификация подлинности

⚠ Важная особенность: в отличие от большинства крупных краулеров, классический распределённый MJ12bot исторически не поддаётся надёжной верификации через простой обратный DNS lookup — именно эта особенность стала одним из главных стимулов для разработки нового централизованного краулера v2.

#!/bin/bash
# Попытка верификации (ограниченная эффективность для классического MJ12bot):
IP=$1
HOST=$(host $IP | awk '{print $NF}')

if [[ $HOST == *mj12bot.com* ]]; then
  FWD=$(host $HOST | awk '{print $NF}')
  if [[ $FWD == $IP ]]; then
    echo "✔ Подтверждено через DNS: $IP → $HOST"
  else
    echo "✖ DNS mismatch: $IP"
  fi
else
  echo "⚠ Нет подтверждающей PTR-записи — типично для распределённой сети MJ12bot.
  Это не всегда означает подделку, но требует дополнительной осторожности."
fi

Практическая рекомендация: поскольку надёжная DNS-верификация классического MJ12bot затруднена, для критичных решений (например, выдачи разного контента в зависимости от бота) полагайтесь на комбинацию факторов: паттерн поведения (систематический обход ссылок, а не хаотичные запросы), отсутствие признаков вредоносной активности, и при необходимости — обращение в официальную поддержку Majestic через mj12bot.com.

5. Управление MJ12bot

5.1 Полная блокировка через robots.txt

User-agent: MJ12bot
Disallow: /

Последствие: блокировка не повлияет на позиции сайта в Google, Bing или Яндексе — MJ12bot не передаёт данные в поисковые алгоритмы. Эффект ограничивается исключительно точностью данных о вашем сайте в инструментах Majestic (Trust Flow, Citation Flow, Site Explorer).

5.2 Рекомендуемый компромисс — Crawl-delay вместо блокировки

User-agent: MJ12bot
Crawl-delay: 30
Disallow: /admin/
Disallow: /private/
Disallow: /staging/
Disallow: /api/
Allow: /blog/
Allow: /

5.3 Ограничение по времени суток (off-peak crawling)

Для сайтов, где нагрузка от MJ12bot заметна в часы пиковой пользовательской активности, можно настроить разрешение обхода только в непиковые часы на уровне сервера:

# Nginx — пример ограничения через geo/map в комбинации с условием времени
# (требует дополнительной логики на уровне приложения или специализированных модулей,
# так как чистый Nginx не поддерживает условия по времени из коробки) —
# альтернатива: настройка через внешний скрипт-обёртку или WAF-правило по расписанию.

5.4 Rate limiting через Nginx

# Ограничить MJ12bot до 60 запросов в минуту:
limit_req_zone $http_user_agent zone=mj12:10m rate=60r/m;

map $http_user_agent $limit_mj12 {
    default 0;
    "~*MJ12bot" 1;
}

location / {
    if ($limit_mj12) {
        limit_req zone=mj12 burst=10;
    }
}

5.5 Блокировка через .htaccess (Apache)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} MJ12bot [NC]
RewriteRule .* - [F,L]

5.6 Подготовка к новому краулеру v2

Учитывая, что новый централизованный краулер находится на финальной стадии бета-тестирования, рекомендуется:

  • Периодически проверять блог Majestic (blog.majestic.com) и микросайт с деталями нового User-Agent на предмет официального релиза
  • Не предпринимать срочных действий — по заявлению Majestic, новый краулер будет уважать существующие правила для MJ12bot минимум 12 месяцев после релиза
  • После публикации точного токена нового User-Agent — рассмотреть, нужно ли настраивать для него отдельные правила (например, если хотите получить преимущества улучшенной верификации, но управлять обоими краулерами по-разному)

6. Диагностика проблем

6.1 Типичные проблемы и решения

Проблема Причина Решение
MJ12bot создаёт заметную нагрузку Распределённая архитектура, отсутствие Crawl-delay Установить Crawl-delay 30–60 секунд
Не получается верифицировать IP через DNS Особенность распределённой сети — нет единообразных PTR-записей Дождаться перехода на v2 или оценивать по паттерну поведения
Данные Trust Flow/Citation Flow устарели Бот заблокирован полностью Проверить robots.txt, рассмотреть Crawl-delay вместо Disallow
Появились записи с незнакомым User-Agent похожим на MJ12bot Вероятно, новый централизованный краулер v2 на стадии бета Дождаться официальной публикации токена, временно не блокировать без необходимости
Подозрение на подделку User-Agent Из-за сложности верификации MJ12bot — частая цель для маскировки Анализировать паттерн поведения, обращаться в поддержку Majestic при сомнениях

6.2 Пошаговая диагностика

Шаг 1 — Проверить robots.txt:

curl https://example.com/robots.txt | grep -i 'mj12bot'

Шаг 2 — Проверить доступность сайта для бота:

curl -A "Mozilla/5.0 (compatible; MJ12bot/v1.4.8; http://mj12bot.com/)" \
  -I https://example.com/
# Ожидается: HTTP/1.1 200 OK

Шаг 3 — Оценить реальное влияние на сервер:

# Сравнить долю MJ12bot в общем трафике:
echo "Всего запросов:"
wc -l access.log
echo "Запросов от MJ12bot:"
grep -ci 'mj12bot' access.log

Шаг 4 — При сомнениях в легитимности — обратиться в Majestic:

# Официальный сайт с FAQ и контактами:
https://mj12bot.com/

7. MJ12bot vs другие крупные ссылочные краулеры

Краулер Компания Год запуска Архитектура Фокус Crawl-delay
MJ12bot Majestic 2004 Распределённая (+ новая централизованная v2) Преимущественно ссылки ✔ Поддерживает
AhrefsBot Ahrefs 2010-е Централизованная Ссылки + контент ✔ Поддерживает (до 30 сек)
SemrushBot Semrush 2008 Централизованная, семейство ботов Ссылки, аудит, контент, позиции ✔ Поддерживает (до 10 сек)
DotBot (Moz) Moz 2000-е Централизованная Domain Authority, ссылки ✔ Поддерживает

Контекст из реальных данных: по статистике pbnshield за тот же период, AhrefsBot занял позицию заметно ниже MJ12bot (около 0.3% против 0.6%), а SemrushBot — выше (1.3%). Несмотря на свой возраст, MJ12bot остаётся весомым игроком в этой категории, особенно с учётом его взрывного роста в исследуемый период.

8. Рекомендуемая стратегия

✔ Главный принцип: MJ12bot — легитимный, но заметно более ресурсоёмкий краулер по сравнению с большинством SEO-ботов. Используйте Crawl-delay как основной инструмент баланса между точностью данных Majestic и нагрузкой на сервер, прежде чем переходить к полной блокировке.

Задача Решение
Снизить нагрузку, сохранив данные в Majestic Crawl-delay: 3060 в зависимости от ситуации
Полностью исключить сайт из индекса Majestic User-agent: MJ12bot / Disallow: /
Защитить чувствительные разделы Точечный Disallow для /admin/, /private/, /staging/, /api/
Оценить реальное влияние на сервер grep + расчёт доли от общего трафика
Подготовиться к переходу на v2 Следить за blog.majestic.com, не паниковать заранее
Снизить нагрузку через rate limiting Nginx limit_req_zone по User-Agent
Оценить легитимность подозрительного трафика Анализ паттерна поведения + обращение в поддержку Majestic

 

Другие гайды по ботам

Частые вопросы

Почему MJ12bot создаёт такую заметную нагрузку на сервер?

Историческая причина — распределённая архитектура бота: вместо единого централизованного краулера Majestic десятилетиями использовала сеть из десятков тысяч отдельных машин, выполняющих обход параллельно. Это делает MJ12bot одной из самых масштабных краулинговых операций в интернете и объясняет его репутацию умеренно агрессивного бота по сравнению с более централизованными конкурентами.

Почему я не могу надёжно верифицировать MJ12bot через обратный DNS?

Это известная и официально признанная самой Majestic проблема классического распределённого MJ12bot: из-за архитектуры с десятками тысяч отдельных машин не у каждой из них есть единообразная и предсказуемая PTR-запись, в отличие, например, от Googlebot. Именно эта сложность верификации стала одним из главных стимулов для разработки нового централизованного краулера, который должен полноценно поддерживать верификацию через reverse DNS.

Что такое новый краулер v2 MJ12bot, упомянутый Majestic?

В течение 2025 года Majestic вела разработку второго, централизованного краулера, дополняющего историческую распределённую сеть. На момент написания статьи новый краулер находится на финальной стадии бета-тестирования. Это не замена существующего MJ12bot, а параллельная инфраструктура — оба краулера продолжат работать совместно. Точные детали нового User-Agent токена будут опубликованы Majestic на отдельном микросайте.

Нужно ли срочно менять robots.txt из-за появления нового краулера v2?

Нет, по прямому заявлению самой Majestic — паниковать не нужно. Новый краулер будет уважать все правила robots.txt, адресованные классическому MJ12bot, как минимум в течение 12 месяцев после финального релиза. Только продвинутые пользователи, желающие настроить раздельные правила для двух краулеров, должны будут добавить отдельную директиву после официальной публикации нового токена.

Какую задержку Crawl-delay рекомендуется устанавливать для MJ12bot?

Зависит от нагрузки вашего сервера и приоритетов. Многие сайты выбирают компромисс в диапазоне 30–60 секунд между запросами — это заметно снижает влияние бота на производительность, при этом сохраняя присутствие сайта в индексе Majestic для целей Trust Flow и Citation Flow. Рекомендуется отслеживать фактическое воздействие через анализ логов и корректировать значение по результатам, а не устанавливать его произвольно.

Как отличить настоящий MJ12bot от подделки, если DNS-верификация затруднена?

Поскольку классический распределённый MJ12bot не всегда поддаётся надёжной проверке через обратный DNS, рекомендуется комплексный подход: анализировать паттерн поведения трафика (систематический, предсказуемый обход страниц с фокусом на обнаружение ссылок — типичное поведение легитимного краулера, в отличие от хаотичных или подозрительных запросов скрейперов), отсутствие признаков вредоносной активности (попытки эксплуатации, брутфорс форм и т.п.), и при серьёзных сомнениях — обращаться напрямую в поддержку Majestic через официальный сайт mj12bot.com.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

GPTBot

GPTBot — краулер OpenAI, который собирает публично доступный веб-контент для обучения будущих поколений генеративных моделей семейства GPT. Это один из первых официально задокументированных ИИ-краулеров на рынке (представлен в августе 2023 года) и на сегодня — самый узнаваемый бот OpenAI среди веб-мастеров.

4 мин

OAI-AdsBot

OAI-AdsBot — самый новый краулер OpenAI, впервые появившийся в официальной документации в апреле 2026 года. Он обслуживает рекламную инфраструктуру ChatGPT: когда рекламодатель размещает объявление в ChatGPT Ads, этот бот посещает указанную посадочную страницу, чтобы проверить её на соответствие рекламным политикам OpenAI и, при необходимости, использовать содержимое страницы для оценки релевантности показа объявления.

3 мин

Keys.so Bot (keys-so-bot)

Keys-so-bot — краулер российского SEO-сервиса Keys.so (оператор — компания «Битерика Групп»), который используется для сбора данных о видимости сайтов в органической и контекстной выдаче Яндекса и Google, анализа семантического ядра конкурентов и построения истории изменений файлов robots.txt. Это не поисковый робот в классическом смысле — он не индексирует страницы для показа в результатах поиска, а сканирует сайты в интересах пользователей сервиса, которые анализируют конкурентов.

3 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.