TrafficVeil
Боты 4 мин1 августа 2026 г.

GrokBot и семейство краулеров xAI

GrokBot — основной веб-краулер компании xAI (детище Илона Маска), созданный для сбора обучающих данных и обеспечения работы ИИ-ассистента Grok. В отличие от большинства крупных краулеров, xAI публикует крайне мало официальной документации, а часть трафика от сервисов Grok маскируется под обычный браузерный User-Agent. Это делает GrokBot одним из наиболее проблемных и плохо верифицируемых ботов в современном вебе.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое GrokBot?
  2. Семейство краулеров xAI
  3. Идентификационная таблица GrokBot
  4. 2. Как работает GrokBot
  5. Проблема: скрытый трафик и спуфинг User-Agent
  6. 3. Нагрузка на сервер
  7. 4. Как обнаружить GrokBot в логах сервера
  8. Поиск в логах Nginx / Apache (bash)
  9. Поиск аномальных паттернов (косвенные признаки)
  10. 5. Управление через robots.txt
  11. Полная блокировка всего семейства xAI
  12. Разрешение только Live-Fetch (поиск и цитирование), блокировка обучения
  13. Частичный доступ: только публичный контент
  14. 6. Блокировка на уровне сервера
  15. Nginx
  16. Apache (.htaccess)
  17. Ограничение скорости (rate limiting) вместо полной блокировки
  18. Блокировка через pbnshield
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

1. Что такое GrokBot?

Grok — это крупная языковая модель, разработанная компанией xAI и интегрированная в платформу X (бывший Twitter). Для работы модели требуется постоянный сбор актуальных данных из открытого интернета. Эту задачу выполняет семейство краулеров xAI, из которых GrokBot является основным тренировочным агентом.

xAI не публикует единой страницы с документацией для своих ботов. Сведения о семействе краулеров собраны из разрозненных источников: robots.txt самого сайта x.ai, отчётов вебмастеров и сторонних каталогов ботов.

Семейство краулеров xAI

xAI использует несколько различных User-Agent'ов в зависимости от цели обхода. Каждый из них можно разрешить или заблокировать независимо:

User-Agent Тип Назначение Достоверность
GrokBot/1.0 Тренировочный краулер Сбор данных для обучения моделей Grok ⚠️ предположительно
xAI-Grok/1.0 Тренировочный краулер Индексирование базы знаний Grok ⚠️ предположительно
xAI-Bot Тренировочный краулер Общий краулер семейства xAI ✅ достоверно
Grok-User Live-Fetch (по запросу) Загрузка страниц по запросу пользователя в Grok ⚠️ предположительно
Grok-Web Live-Fetch (по запросу) Веб-поиск в реальном времени для ответов Grok ⚠️ предположительно
Grok-DeepSearch/1.0 ИИ-агент Агентный режим DeepSearch (введён с Grok 3, февраль 2025) ⚠️ предположительно
iPhone Safari UA (спуфинг) Скрытый краулер Трафик Grok, маскирующийся под обычный браузер ✅ достоверно (задокументировано вебмастерами)

⚠️ Важно: xAI не опубликовала официальной страницы с документацией для своих краулеров. Большинство строк User-Agent задокументированы сторонними сервисами мониторинга ботов, а не самой компанией. Проверяйте актуальные строки на сайте x.ai перед применением правил.

Идентификационная таблица GrokBot

Параметр Значение Статус
Оператор xAI (компания Илона Маска) ✅ достоверно
Основной User-Agent GrokBot/1.0, xAI-Bot ⚠️ предположительно / ✅
Официальная документация Отсутствует ✅ достоверно (подтверждено исследователями)
Публикация IP-диапазонов Не опубликованы ✅ достоверно
Верификация по reverse DNS Не поддерживается ✅ достоверно
Соблюдение robots.txt Непоследовательно; часто игнорируется ⚠️ предположительно
Соблюдение Crawl-delay Не соблюдается ⚠️ предположительно
JavaScript-рендеринг Нет (в режиме тренировочного краулера) ⚠️ предположительно
Официальный контакт Не указан ❌ не подтверждено

2. Как работает GrokBot

Семейство краулеров xAI выполняет три принципиально разные задачи, которые важно разграничивать при настройке правил доступа:

  1. Тренировочный обход (GrokBot, xAI-Grok, xAI-Bot). Систематически обходит открытые веб-страницы для пополнения обучающей выборки будущих версий Grok. Трафик носит периодический характер: спайки возникают перед релизами новых версий модели, после чего активность снижается. Не возвращает пользователей на ваш сайт — контент поглощается однократно и встраивается в веса модели.
  2. Поиск в реальном времени (Grok-Web, Grok-DeepSearch). Поддерживает функцию DeepSearch — агентный режим поиска, введённый с Grok 3 в феврале 2025 года. Именно этот тип трафика генерирует цитирования и может приносить реферальные переходы.
  3. Загрузка по запросу (Grok-User). Срабатывает, когда пользователь в интерфейсе Grok передаёт конкретный URL или задаёт вопрос о странице. Аналог ChatGPT-User от OpenAI.

Отдельный канал данных — фидхос X (Twitter): Grok получает посты из X напрямую через внутреннюю интеграцию, минуя веб-краулинг. Этот поток недоступен для управления через robots.txt или серверные правила.

Проблема: скрытый трафик и спуфинг User-Agent

Наиболее серьёзная особенность Grok — задокументированное использование поддельных User-Agent строк. В ряде случаев трафик от Grok поступает со строкой, имитирующей мобильный браузер Safari:

Mozilla/5.0 (iPhone; CPU iPhone OS 17_0 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.0 Mobile/15E148 Safari/604.1

При таком подходе трафик неотличим от реального мобильного посетителя. Дополнительно сообщается об использовании резидентских IP-адресов и VPN-сетей, в том числе IP-диапазонов SpaceX/Starlink. Это делает идентификацию и блокировку GrokBot значительно сложнее, чем для большинства других ИИ-краулеров.

3. Нагрузка на сервер

Поведение GrokBot при обходе существенно отличается от классических поисковых краулеров:

  • Периодические спайки. Активность резко возрастает перед выходом новых версий Grok и затихает между циклами обучения. В пиковые периоды нагрузка может быть значительной.
  • Отсутствие Crawl-delay. Директива Crawl-delay в robots.txt не соблюдается, что при интенсивном обходе способно создавать нагрузку, схожую с DDoS.
  • Отсутствие реферального трафика от тренировочного краулера. Тренировочный обход (GrokBot, xAI-Grok) не возвращает пользователей на ваш сайт — это чистое потребление ресурсов сервера без выгоды для владельца.
  • Сложность атрибуции. Поскольку часть трафика маскируется под браузерный, реальную нагрузку от xAI сложно оценить по логам.

4. Как обнаружить GrokBot в логах сервера

Из-за спуфинга UA полная идентификация трафика xAI по логам невозможна. Ниже приведены команды для поиска известных User-Agent строк семейства xAI.

Поиск в логах Nginx / Apache (bash)

# Все известные UA-токены семейства xAI
grep -iE "GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch" /var/log/nginx/access.log

# Подсчёт запросов по каждому токену
grep -iE "GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch" /var/log/nginx/access.log \
  | awk '{for(i=1;i<=NF;i++) if($i~/GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch/) print $i}' \
  | sort | uniq -c | sort -rn

# Только GrokBot — IP-адреса и частота
grep -i "GrokBot" /var/log/nginx/access.log \
  | awk '{print $1}' | sort | uniq -c | sort -rn | head -20

# Временная динамика — запросы по часам
grep -iE "GrokBot|xAI-Bot" /var/log/nginx/access.log \
  | awk '{print $4}' | cut -d: -f1-2 | sort | uniq -c

# Для Apache
grep -iE "GrokBot|xAI-Grok|xAI-Bot" /var/log/apache2/access.log

⚠️ Ограничение: Поиск по UA-строкам обнаружит только «честный» трафик xAI. Трафик, маскирующийся под Safari/Chrome, в логах будет выглядеть как обычный браузерный посетитель и не поддаётся надёжной идентификации без анализа поведенческих паттернов.

Поиск аномальных паттернов (косвенные признаки)

# Подозрительная активность iPhone Safari с высокой частотой запросов
# (возможный спуфинг со стороны Grok)
grep "iPhone.*Safari" /var/log/nginx/access.log \
  | awk '{print $1}' | sort | uniq -c | sort -rn | head -30

# IP-адреса с высокой частотой запросов без реферера
awk '$8 == "-" {print $1}' /var/log/nginx/access.log \
  | sort | uniq -c | sort -rn | head -20

5. Управление через robots.txt

Поскольку xAI не публикует официальный список User-Agent токенов, рекомендуется использовать правила для всех известных токенов семейства. Обратите внимание: соблюдение robots.txt краулерами xAI непоследовательно — часть трафика директиву игнорирует.

Полная блокировка всего семейства xAI

# Блокировка всех известных токенов семейства xAI
User-agent: GrokBot
Disallow: /

User-agent: xAI-Grok
Disallow: /

User-agent: xAI-Bot
Disallow: /

User-agent: Grok-User
Disallow: /

User-agent: Grok-Web
Disallow: /

User-agent: Grok-DeepSearch
Disallow: /

Разрешение только Live-Fetch (поиск и цитирование), блокировка обучения

# Разрешаем поиск в реальном времени (потенциальные цитирования)
User-agent: Grok-Web
Allow: /

User-agent: Grok-User
Allow: /

User-agent: Grok-DeepSearch
Allow: /

# Блокируем тренировочные краулеры
User-agent: GrokBot
Disallow: /

User-agent: xAI-Grok
Disallow: /

User-agent: xAI-Bot
Disallow: /

Частичный доступ: только публичный контент

User-agent: xAI-Bot
Allow: /blog/
Allow: /articles/
Disallow: /

Важный нюанс: Блокировка тренировочных краулеров не удаляет ваш бренд из Grok. Grok продолжает описывать бренды на основе накопленных обучающих данных и постов в X. Блокировка лишь исключает ваши страницы как актуальные цитируемые источники.

6. Блокировка на уровне сервера

Поскольку часть трафика xAI игнорирует robots.txt, серверная блокировка является более надёжным инструментом для известных UA-токенов.

Nginx

# /etc/nginx/conf.d/block_xai.conf

map $http_user_agent $block_xai {
    default         0;
    "~*GrokBot"     1;
    "~*xAI-Grok"    1;
    "~*xAI-Bot"     1;
    # Раскомментировать для блокировки Live-Fetch агентов:
    # "~*Grok-User"   1;
    # "~*Grok-Web"    1;
    # "~*Grok-DeepSearch" 1;
}

server {
    # ... ваши настройки ...

    if ($block_xai) {
        return 403;
    }
}

Apache (.htaccess)

# Блокировка семейства xAI в .htaccess
<IfModule mod_rewrite.c>
    RewriteEngine On

    RewriteCond %{HTTP_USER_AGENT} GrokBot [NC,OR]
    RewriteCond %{HTTP_USER_AGENT} xAI-Grok [NC,OR]
    RewriteCond %{HTTP_USER_AGENT} xAI-Bot [NC]
    RewriteRule .* - [F,L]
</IfModule>

# Альтернативный вариант через BrowserMatch
BrowserMatch "GrokBot" bad_bot
BrowserMatch "xAI-Grok" bad_bot
BrowserMatch "xAI-Bot" bad_bot
<Directory />
    Order Allow,Deny
    Allow from all
    Deny from env=bad_bot
</Directory>

Ограничение скорости (rate limiting) вместо полной блокировки

Если полная блокировка нежелательна (например, из-за риска потери цитирований в DeepSearch), рекомендуем применять rate limiting:

# Nginx: ограничение для xAI-ботов до 10 запросов/мин
geo $xai_bot_zone {
    default 0;
}

map $http_user_agent $xai_limit {
    "~*GrokBot|xAI-Grok|xAI-Bot" 1;
    default 0;
}

limit_req_zone $binary_remote_addr zone=xai_bots:10m rate=10r/m;

server {
    location / {
        if ($xai_limit) {
            limit_req zone=xai_bots burst=5 nodelay;
        }
        # ... ваша конфигурация ...
    }
}

Блокировка через pbnshield

В интерфейсе pbnshield перейдите в раздел управления ботами и создайте правило для User-Agent токенов GrokBot, xAI-Grok, xAI-Bot. Правило автоматически применится ко всем доменам в вашем аккаунте. Обратите внимание, что трафик xAI, маскирующийся под браузер, не будет перехвачен UA-фильтром — для его ограничения используйте поведенческий анализ pbnshield.

7. Сравнение с аналогичными ИИ-краулерами

Параметр GrokBot (xAI) GPTBot (OpenAI) ClaudeBot (Anthropic) PerplexityBot
Официальная документация ❌ Отсутствует ✅ Подробная ✅ Есть ✅ Есть
Публикация IP-диапазонов ❌ Нет ✅ JSON-файл ❌ Нет (намеренно) ⚠️ Частично
Reverse DNS верификация ❌ Нет ✅ Есть ❌ Нет ⚠️ Ограничена
Соблюдение robots.txt ⚠️ Непоследовательно ✅ Да ✅ Да ⚠️ Нарушения зафиксированы
Спуфинг User-Agent ✅ Зафиксирован ❌ Нет ❌ Нет ✅ Зафиксирован (Cloudflare, 2025)
Реферальный трафик ⚠️ Только DeepSearch ⚠️ Только OAI-SearchBot ⚠️ Только Claude-SearchBot ✅ Да
Нагрузка на сервер ⚠️ Высокая (в спайки) ⚠️ Умеренная ⚠️ Умеренная ⚠️ Умеренная

8. Стратегия управления: сводная таблица

Тип сайта / ситуация Рекомендуемая стратегия Обоснование
Новостной сайт, блог, публичный контент Разрешить Grok-Web, Grok-DeepSearch; заблокировать GrokBot/xAI-Grok Потенциальные цитирования в DeepSearch без отдачи данных для обучения
Коммерческий сайт с закрытыми данными Заблокировать всё семейство xAI на уровне сервера Защита контента, не приносит реферального трафика
SaaS, веб-приложение Rate limiting + блокировка тренировочных UA Защита от нагрузки, допустимость цитирований
PBN / дорвеи Заблокировать всё семейство xAI Исключение нежелательного анализа
SEO-агентство, информационный портал Разрешить всё семейство xAI Максимальное присутствие в ответах Grok и DeepSearch

 

Статья подготовлена командой Trafficfeil. Данные актуальны на август 2026 года. Поскольку xAI не публикует официальной документации для своих краулеров, часть сведений основана на наблюдениях сообщества вебмастеров и сторонних каталогов ботов. Всегда проверяйте актуальные UA-токены перед применением правил.

 

Частые вопросы

Почему я не вижу GrokBot в своих логах, хотя Grok явно посещает мой сайт?

Часть трафика от xAI использует поддельные User-Agent строки, имитирующие мобильный браузер Safari или Chrome. Такой трафик не отображается при фильтрации по токену «GrokBot» и выглядит как обычный браузерный посетитель. Это задокументированное поведение, подтверждённое исследователями и сообществом вебмастеров.

Если я заблокирую GrokBot, исчезнет ли мой сайт из ответов Grok?

Не полностью. Grok продолжит описывать ваш бренд на основе накопленных обучающих данных и публикаций в X (Twitter). Блокировка тренировочных краулеров лишает вас роли актуального цитируемого источника в режиме DeepSearch, но не удаляет бренд из модели

Повлияет ли блокировка xAI на позиции в Google?

Нет. GrokBot собирает обучающие данные для ИИ-модели, а не индексирует страницы для поисковой выдачи. Правила robots.txt для xAI-Bot и Googlebot обрабатываются независимо.

Что такое Grok DeepSearch и чем он отличается от GrokBot?

DeepSearch — агентный режим поиска, введённый в Grok 3 (февраль 2025). Он выполняет поиск в реальном времени для формирования ответов с цитированием источников. В отличие от тренировочного GrokBot, DeepSearch может приносить реферальный трафик, так как пользователи видят ссылки на проиндексированные страницы.

Стоит ли разрешать или блокировать Grok-User?

Это зависит от вашей стратегии. Grok-User срабатывает, когда пользователь передаёт конкретный URL в интерфейс Grok. Разрешение позволяет Grok корректно читать и интерпретировать страницы по прямому запросу пользователя, что может улучшить качество ответов о вашем контенте. Если сайт публичный — рекомендуем разрешить.

Почему часть трафика xAI использует IP-адреса SpaceX/Starlink?

По данным вебмастеров, часть активности, приписываемой xAI, поступает с резидентских IP-адресов и VPN-сетей, в том числе из диапазонов SpaceX. Это может быть связано с использованием инфраструктуры компаний, принадлежащих Илону Маску, либо с намеренной ротацией IP для обхода блокировок. Официального объяснения от xAI нет.

Как настроить WAF/CDN, чтобы не блокировать Grok случайно?

Стандартные профили защиты от ботов в Cloudflare, Akamai и Fastly часто блокируют AI-краулеры, так как те не имеют репутационной истории, сопоставимой с Googlebot. Проверяйте события файрвола на наличие запросов с xAI-токенами и создавайте явные правила разрешения для тех агентов, которых хотите допустить.

Нужно ли регулярно обновлять список токенов xAI?

Да, и это особенно важно именно для xAI. Компания активно развивает линейку продуктов, а документация не публикуется централизованно. Рекомендуем ежеквартально проверять актуальные строки на сайте x.ai и в отраслевых каталогах ботов.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Claude Search Bot

Claude-SearchBot — краулер Anthropic, отвечающий за качество и релевантность поисковых функций Claude. Он индексирует публичный веб-контент, чтобы Claude мог возвращать актуальные, точные ответы с цитированием источников, когда пользователь задаёт вопрос, требующий свежих данных из интернета. Это не обучающий краулер: собранные данные используются исключительно для поискового слоя Claude, а не для тренировки моделей.

3 мин

Claude User

Claude-User — агент Anthropic, который срабатывает не по расписанию, а по прямому действию пользователя. Когда человек в Claude просит прочитать конкретную страницу, вставляет ссылку в диалог или задаёт вопрос, требующий обращения к конкретному URL, именно Claude-User выполняет этот запрос в моменте. Это не плановый краулер, а реактивный агент, чьё появление в логах коррелирует с объёмом пользовательских запросов, а не с расписанием индексации.

5 мин

ClaudeBot

ClaudeBot — основной краулер Anthropic, который собирает публично доступный веб-контент для обучения и улучшения генеративных моделей семейства Claude. Это самый узнаваемый и старый из трёх официально задокументированных ботов Anthropic, находящийся в центре большей части публичной дискуссии об AI-краулерах — в том числе из-за нашумевших данных Cloudflare о крайне высоком соотношении «сканирование / переходы по ссылкам» у AI-краулеров в целом.

5 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.