Боты5 мин чтения·12 августа 2026 г.

MojeekBot: краулер полностью независимого британского поиска — не AI-краулер для LLM

MojeekBot строит собственный, полностью независимый поисковый индекс для Mojeek — британской поисковой системы с 2004 года, написанной на уникальном коде без опоры на Google или Bing. Разбираем необычно детальную официальную документацию бота — жёсткий лимит в один запрос в секунду без поддержки crawl-delay, логику выбора секции robots.txt при её отсутствии, и реальный пример двухшаговой DNS-верификации из независимого разбора логов.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота MojeekBot: легитимный поисковые роботы

MojeekBot принадлежит Mojeek — британской поисковой системе, основанной в 2004 году, которая с самого начала строит полностью независимый поисковый индекс, написанный на собственном уникальном коде, а не лицензирующий или переиспользующий чужие результаты. Это принципиально отличает Mojeek от многих альтернативных поисковиков, которые лишь оборачивают выдачу Google или Bing своим интерфейсом, — и делает MojeekBot настоящим, самостоятельным поисковым краулером, а не AI-обучающим ботом в смысле LLM.

Официальная страница бота — редкий образец детальной прозрачности

На странице mojeek.com/bot.html компания подробно и однозначно документирует поведение своего краулера, включая жёсткие технические ограничения: MojeekBot не должен запрашивать более одной страницы с сайта в течение одного и того же секундного окна, вне зависимости от того, был ли предыдущий запрос успешным. При этом бот прямо заявляет, что не поддерживает нестандартную директиву crawl-delay в robots.txt, — у него есть собственный встроенный лимит скорости, который директивой изменить нельзя.

Отдельно описана логика выбора применяемой секции robots.txt: MojeekBot будет следовать первой найденной записи с User-Agent, содержащим «MojeekBot»; если такой записи нет, он использует первую запись с общим *. Это значит, что даже без отдельной секции именно под MojeekBot общее правило для всех ботов на него всё равно распространяется — в отличие от специализированных краулеров вроде YandexFavicons или YandexAccessibilityBot из этой серии, которые официально общие правила игнорируют.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 (compatible; MojeekBot/0.11; +https://www.mojeek.com/bot.html) — номер версии со временем менялся, встречались варианты от 0.2 до 2.0
Оператор Mojeek Ltd. (Великобритания), поиск основан в 2004 году
Официальная документация mojeek.com/bot.html
Частота запросов Не более одного запроса с сайта в секунду — жёсткое встроенное ограничение, не настраиваемое через crawl-delay
Соблюдение robots.txt Да, полностью — следует первой найденной секции для «MojeekBot», а при её отсутствии применяет общую секцию *
Поддержка meta-директив Учитывает meta-теги noindex, nocache/noarchive и nofollow на странице
Верификация Двойной DNS lookup: обратный запрос по IP должен приводить к поддомену вида crawl-*.mojeek.com, прямой запрос по этому имени должен подтвердить исходный IP; альтернативно — сверка со списком IP-адресов на официальной странице бота

Пример реальной верификации из независимого разбора логов

В одном из независимых технических разборов зафиксирован конкретный кейс: запрос пришёл с IP 5.102.173.71, обратный DNS-запрос вернул crawl-5-102-173-71.mojeek.com, а последующий прямой запрос по этому имени подтвердил тот же исходный IP — классический пример успешной двухшаговой верификации, которую стоит повторять при любом сомнении в подлинности конкретного запроса, а не полагаться на одну лишь строку User-Agent.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Почему присутствие MojeekBot — не про LLM и AI-обучение

Стоит явно развести два разных явления, которые иногда путают из-за общего слова «AI» в современном контексте: MojeekBot строит классический поисковый индекс для собственной, полностью независимой поисковой системы — совершенно того же типа задача, что и у Googlebot или YandexBot, только для нишевой, ориентированной на приватность аудитории. Это не AI-краулер, собирающий сырьё для обучения языковой модели, и не должен смешиваться в одну категорию с GPTBot, ClaudeBot или аналогичными ботами из этой серии.

Сколько трафика он создаёт

По сводке TrafficVeil, паттерн запросов mojeekbot на подключённых доменах составил порядка 2,6 тысячи. Учитывая жёсткое встроенное ограничение в один запрос в секунду на сайт, это ожидаемо умеренный и предсказуемый объём, зависящий от размера и популярности конкретного сайта, а не от агрессивности бота.

Как найти бота в логах и проверить подлинность

grep -i "MojeekBot" /var/log/nginx/access.log
host <IP>
# ожидаемый результат — поддомен вида crawl-*.mojeek.com
host crawl-*.mojeek.com
# должен вернуть тот же исходный IP

Стоит ли блокировать

  • если для сайта важна видимость в независимых, не завязанных на Google или Bing поисковых системах — особенно для аудитории, ценящей приватность и отсутствие персонализации выдачи, — MojeekBot стоит явно разрешить;
  • если у сайта нет стратегии на видимость в нишевых независимых поисковиках — блокировка не приведёт к существенным потерям трафика, учитывая относительно небольшой масштаб аудитории Mojeek по сравнению с основными поисковыми системами;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие MojeekBot не влияет — это полностью отдельный, независимый индекс.

Как настроить robots.txt

Явное разрешение:

User-agent: MojeekBot
Allow: /

Полный запрет:

User-agent: MojeekBot
Disallow: /

Частичное ограничение — закрыть служебные разделы, оставив остальной сайт доступным для индексации:

User-agent: MojeekBot
Disallow: /admin/
Disallow: /private/
Allow: /

Частые вопросы

MojeekBot — это AI-краулер для обучения языковых моделей?
Нет, это классический поисковый краулер, который строит собственный независимый индекс для поисковой системы Mojeek — того же типа задача, что у Googlebot или YandexBot.
Поддерживает ли бот директиву crawl-delay?
Нет, официально это прямо заявлено — у бота собственный жёсткий встроенный лимит не более одного запроса в секунду, который директивой не изменить.
Что произойдёт, если не задать отдельную секцию для MojeekBot в robots.txt?
Бот применит общую секцию для всех ботов (*), в отличие от специализированных краулеров вроде YandexFavicons, которые общие правила игнорируют.
Как проверить подлинность запроса от настоящего MojeekBot?
Через двойной DNS lookup — обратный запрос по IP должен приводить к поддомену crawl-*.mojeek.com, а прямой запрос по этому имени — подтвердить исходный IP.
Чем Mojeek принципиально отличается от многих альтернативных поисковиков?
Строит полностью независимый индекс на собственном уникальном коде, а не переиспользует выдачу Google или Bing под своим интерфейсом.
Повлияет ли блокировка на позиции в Google, Bing или Яндексе?
Нет, индекс Mojeek полностью отдельный и независимый от этих систем.
#mojeekbot#Mojeek#независимый поиск#приватный поиск#бот-энциклопедия#robots.txt#rDNS#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil