MojeekBot принадлежит Mojeek — британской поисковой системе, основанной в 2004 году, которая с самого начала строит полностью независимый поисковый индекс, написанный на собственном уникальном коде, а не лицензирующий или переиспользующий чужие результаты. Это принципиально отличает Mojeek от многих альтернативных поисковиков, которые лишь оборачивают выдачу Google или Bing своим интерфейсом, — и делает MojeekBot настоящим, самостоятельным поисковым краулером, а не AI-обучающим ботом в смысле LLM.
Официальная страница бота — редкий образец детальной прозрачности
На странице mojeek.com/bot.html компания подробно и однозначно документирует поведение своего краулера, включая жёсткие технические ограничения: MojeekBot не должен запрашивать более одной страницы с сайта в течение одного и того же секундного окна, вне зависимости от того, был ли предыдущий запрос успешным. При этом бот прямо заявляет, что не поддерживает нестандартную директиву crawl-delay в robots.txt, — у него есть собственный встроенный лимит скорости, который директивой изменить нельзя.
Отдельно описана логика выбора применяемой секции robots.txt: MojeekBot будет следовать первой найденной записи с User-Agent, содержащим «MojeekBot»; если такой записи нет, он использует первую запись с общим *. Это значит, что даже без отдельной секции именно под MojeekBot общее правило для всех ботов на него всё равно распространяется — в отличие от специализированных краулеров вроде YandexFavicons или YandexAccessibilityBot из этой серии, которые официально общие правила игнорируют.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; MojeekBot/0.11; +https://www.mojeek.com/bot.html) — номер версии со временем менялся, встречались варианты от 0.2 до 2.0 |
| Оператор | Mojeek Ltd. (Великобритания), поиск основан в 2004 году |
| Официальная документация | mojeek.com/bot.html |
| Частота запросов | Не более одного запроса с сайта в секунду — жёсткое встроенное ограничение, не настраиваемое через crawl-delay |
| Соблюдение robots.txt | Да, полностью — следует первой найденной секции для «MojeekBot», а при её отсутствии применяет общую секцию * |
| Поддержка meta-директив | Учитывает meta-теги noindex, nocache/noarchive и nofollow на странице |
| Верификация | Двойной DNS lookup: обратный запрос по IP должен приводить к поддомену вида crawl-*.mojeek.com, прямой запрос по этому имени должен подтвердить исходный IP; альтернативно — сверка со списком IP-адресов на официальной странице бота |
Пример реальной верификации из независимого разбора логов
В одном из независимых технических разборов зафиксирован конкретный кейс: запрос пришёл с IP 5.102.173.71, обратный DNS-запрос вернул crawl-5-102-173-71.mojeek.com, а последующий прямой запрос по этому имени подтвердил тот же исходный IP — классический пример успешной двухшаговой верификации, которую стоит повторять при любом сомнении в подлинности конкретного запроса, а не полагаться на одну лишь строку User-Agent.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Почему присутствие MojeekBot — не про LLM и AI-обучение
Стоит явно развести два разных явления, которые иногда путают из-за общего слова «AI» в современном контексте: MojeekBot строит классический поисковый индекс для собственной, полностью независимой поисковой системы — совершенно того же типа задача, что и у Googlebot или YandexBot, только для нишевой, ориентированной на приватность аудитории. Это не AI-краулер, собирающий сырьё для обучения языковой модели, и не должен смешиваться в одну категорию с GPTBot, ClaudeBot или аналогичными ботами из этой серии.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов mojeekbot на подключённых доменах составил порядка 2,6 тысячи. Учитывая жёсткое встроенное ограничение в один запрос в секунду на сайт, это ожидаемо умеренный и предсказуемый объём, зависящий от размера и популярности конкретного сайта, а не от агрессивности бота.
Как найти бота в логах и проверить подлинность
grep -i "MojeekBot" /var/log/nginx/access.log
host <IP>
# ожидаемый результат — поддомен вида crawl-*.mojeek.com
host crawl-*.mojeek.com
# должен вернуть тот же исходный IP
Стоит ли блокировать
- если для сайта важна видимость в независимых, не завязанных на Google или Bing поисковых системах — особенно для аудитории, ценящей приватность и отсутствие персонализации выдачи, — MojeekBot стоит явно разрешить;
- если у сайта нет стратегии на видимость в нишевых независимых поисковиках — блокировка не приведёт к существенным потерям трафика, учитывая относительно небольшой масштаб аудитории Mojeek по сравнению с основными поисковыми системами;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие MojeekBot не влияет — это полностью отдельный, независимый индекс.
Как настроить robots.txt
Явное разрешение:
User-agent: MojeekBot
Allow: /
Полный запрет:
User-agent: MojeekBot
Disallow: /
Частичное ограничение — закрыть служебные разделы, оставив остальной сайт доступным для индексации:
User-agent: MojeekBot
Disallow: /admin/
Disallow: /private/
Allow: /Частые вопросы
MojeekBot — это AI-краулер для обучения языковых моделей?
Поддерживает ли бот директиву crawl-delay?
Что произойдёт, если не задать отдельную секцию для MojeekBot в robots.txt?
Как проверить подлинность запроса от настоящего MojeekBot?
Чем Mojeek принципиально отличается от многих альтернативных поисковиков?
Повлияет ли блокировка на позиции в Google, Bing или Яндексе?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.