1. Что такое GrokBot?
Grok — это крупная языковая модель, разработанная компанией xAI и интегрированная в платформу X (бывший Twitter). Для работы модели требуется постоянный сбор актуальных данных из открытого интернета. Эту задачу выполняет семейство краулеров xAI, из которых GrokBot является основным тренировочным агентом.
xAI не публикует единой страницы с документацией для своих ботов. Сведения о семействе краулеров собраны из разрозненных источников: robots.txt самого сайта x.ai, отчётов вебмастеров и сторонних каталогов ботов.
Семейство краулеров xAI
xAI использует несколько различных User-Agent'ов в зависимости от цели обхода. Каждый из них можно разрешить или заблокировать независимо:
| User-Agent | Тип | Назначение | Достоверность |
|---|---|---|---|
GrokBot/1.0 |
Тренировочный краулер | Сбор данных для обучения моделей Grok | ⚠️ предположительно |
xAI-Grok/1.0 |
Тренировочный краулер | Индексирование базы знаний Grok | ⚠️ предположительно |
xAI-Bot |
Тренировочный краулер | Общий краулер семейства xAI | ✅ достоверно |
Grok-User |
Live-Fetch (по запросу) | Загрузка страниц по запросу пользователя в Grok | ⚠️ предположительно |
Grok-Web |
Live-Fetch (по запросу) | Веб-поиск в реальном времени для ответов Grok | ⚠️ предположительно |
Grok-DeepSearch/1.0 |
ИИ-агент | Агентный режим DeepSearch (введён с Grok 3, февраль 2025) | ⚠️ предположительно |
| iPhone Safari UA (спуфинг) | Скрытый краулер | Трафик Grok, маскирующийся под обычный браузер | ✅ достоверно (задокументировано вебмастерами) |
⚠️ Важно: xAI не опубликовала официальной страницы с документацией для своих краулеров. Большинство строк User-Agent задокументированы сторонними сервисами мониторинга ботов, а не самой компанией. Проверяйте актуальные строки на сайте x.ai перед применением правил.
Идентификационная таблица GrokBot
| Параметр | Значение | Статус |
|---|---|---|
| Оператор | xAI (компания Илона Маска) | ✅ достоверно |
| Основной User-Agent | GrokBot/1.0, xAI-Bot |
⚠️ предположительно / ✅ |
| Официальная документация | Отсутствует | ✅ достоверно (подтверждено исследователями) |
| Публикация IP-диапазонов | Не опубликованы | ✅ достоверно |
| Верификация по reverse DNS | Не поддерживается | ✅ достоверно |
| Соблюдение robots.txt | Непоследовательно; часто игнорируется | ⚠️ предположительно |
| Соблюдение Crawl-delay | Не соблюдается | ⚠️ предположительно |
| JavaScript-рендеринг | Нет (в режиме тренировочного краулера) | ⚠️ предположительно |
| Официальный контакт | Не указан | ❌ не подтверждено |
2. Как работает GrokBot
Семейство краулеров xAI выполняет три принципиально разные задачи, которые важно разграничивать при настройке правил доступа:
- Тренировочный обход (GrokBot, xAI-Grok, xAI-Bot). Систематически обходит открытые веб-страницы для пополнения обучающей выборки будущих версий Grok. Трафик носит периодический характер: спайки возникают перед релизами новых версий модели, после чего активность снижается. Не возвращает пользователей на ваш сайт — контент поглощается однократно и встраивается в веса модели.
- Поиск в реальном времени (Grok-Web, Grok-DeepSearch). Поддерживает функцию DeepSearch — агентный режим поиска, введённый с Grok 3 в феврале 2025 года. Именно этот тип трафика генерирует цитирования и может приносить реферальные переходы.
- Загрузка по запросу (Grok-User). Срабатывает, когда пользователь в интерфейсе Grok передаёт конкретный URL или задаёт вопрос о странице. Аналог ChatGPT-User от OpenAI.
Отдельный канал данных — фидхос X (Twitter): Grok получает посты из X напрямую через внутреннюю интеграцию, минуя веб-краулинг. Этот поток недоступен для управления через robots.txt или серверные правила.
Проблема: скрытый трафик и спуфинг User-Agent
Наиболее серьёзная особенность Grok — задокументированное использование поддельных User-Agent строк. В ряде случаев трафик от Grok поступает со строкой, имитирующей мобильный браузер Safari:
Mozilla/5.0 (iPhone; CPU iPhone OS 17_0 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.0 Mobile/15E148 Safari/604.1
При таком подходе трафик неотличим от реального мобильного посетителя. Дополнительно сообщается об использовании резидентских IP-адресов и VPN-сетей, в том числе IP-диапазонов SpaceX/Starlink. Это делает идентификацию и блокировку GrokBot значительно сложнее, чем для большинства других ИИ-краулеров.
3. Нагрузка на сервер
Поведение GrokBot при обходе существенно отличается от классических поисковых краулеров:
- Периодические спайки. Активность резко возрастает перед выходом новых версий Grok и затихает между циклами обучения. В пиковые периоды нагрузка может быть значительной.
- Отсутствие Crawl-delay. Директива
Crawl-delayв robots.txt не соблюдается, что при интенсивном обходе способно создавать нагрузку, схожую с DDoS. - Отсутствие реферального трафика от тренировочного краулера. Тренировочный обход (GrokBot, xAI-Grok) не возвращает пользователей на ваш сайт — это чистое потребление ресурсов сервера без выгоды для владельца.
- Сложность атрибуции. Поскольку часть трафика маскируется под браузерный, реальную нагрузку от xAI сложно оценить по логам.
4. Как обнаружить GrokBot в логах сервера
Из-за спуфинга UA полная идентификация трафика xAI по логам невозможна. Ниже приведены команды для поиска известных User-Agent строк семейства xAI.
Поиск в логах Nginx / Apache (bash)
# Все известные UA-токены семейства xAI
grep -iE "GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch" /var/log/nginx/access.log
# Подсчёт запросов по каждому токену
grep -iE "GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch" /var/log/nginx/access.log \
| awk '{for(i=1;i<=NF;i++) if($i~/GrokBot|xAI-Grok|xAI-Bot|Grok-User|Grok-Web|Grok-DeepSearch/) print $i}' \
| sort | uniq -c | sort -rn
# Только GrokBot — IP-адреса и частота
grep -i "GrokBot" /var/log/nginx/access.log \
| awk '{print $1}' | sort | uniq -c | sort -rn | head -20
# Временная динамика — запросы по часам
grep -iE "GrokBot|xAI-Bot" /var/log/nginx/access.log \
| awk '{print $4}' | cut -d: -f1-2 | sort | uniq -c
# Для Apache
grep -iE "GrokBot|xAI-Grok|xAI-Bot" /var/log/apache2/access.log
⚠️ Ограничение: Поиск по UA-строкам обнаружит только «честный» трафик xAI. Трафик, маскирующийся под Safari/Chrome, в логах будет выглядеть как обычный браузерный посетитель и не поддаётся надёжной идентификации без анализа поведенческих паттернов.
Поиск аномальных паттернов (косвенные признаки)
# Подозрительная активность iPhone Safari с высокой частотой запросов
# (возможный спуфинг со стороны Grok)
grep "iPhone.*Safari" /var/log/nginx/access.log \
| awk '{print $1}' | sort | uniq -c | sort -rn | head -30
# IP-адреса с высокой частотой запросов без реферера
awk '$8 == "-" {print $1}' /var/log/nginx/access.log \
| sort | uniq -c | sort -rn | head -20
5. Управление через robots.txt
Поскольку xAI не публикует официальный список User-Agent токенов, рекомендуется использовать правила для всех известных токенов семейства. Обратите внимание: соблюдение robots.txt краулерами xAI непоследовательно — часть трафика директиву игнорирует.
Полная блокировка всего семейства xAI
# Блокировка всех известных токенов семейства xAI
User-agent: GrokBot
Disallow: /
User-agent: xAI-Grok
Disallow: /
User-agent: xAI-Bot
Disallow: /
User-agent: Grok-User
Disallow: /
User-agent: Grok-Web
Disallow: /
User-agent: Grok-DeepSearch
Disallow: /
Разрешение только Live-Fetch (поиск и цитирование), блокировка обучения
# Разрешаем поиск в реальном времени (потенциальные цитирования)
User-agent: Grok-Web
Allow: /
User-agent: Grok-User
Allow: /
User-agent: Grok-DeepSearch
Allow: /
# Блокируем тренировочные краулеры
User-agent: GrokBot
Disallow: /
User-agent: xAI-Grok
Disallow: /
User-agent: xAI-Bot
Disallow: /
Частичный доступ: только публичный контент
User-agent: xAI-Bot
Allow: /blog/
Allow: /articles/
Disallow: /
Важный нюанс: Блокировка тренировочных краулеров не удаляет ваш бренд из Grok. Grok продолжает описывать бренды на основе накопленных обучающих данных и постов в X. Блокировка лишь исключает ваши страницы как актуальные цитируемые источники.
6. Блокировка на уровне сервера
Поскольку часть трафика xAI игнорирует robots.txt, серверная блокировка является более надёжным инструментом для известных UA-токенов.
Nginx
# /etc/nginx/conf.d/block_xai.conf
map $http_user_agent $block_xai {
default 0;
"~*GrokBot" 1;
"~*xAI-Grok" 1;
"~*xAI-Bot" 1;
# Раскомментировать для блокировки Live-Fetch агентов:
# "~*Grok-User" 1;
# "~*Grok-Web" 1;
# "~*Grok-DeepSearch" 1;
}
server {
# ... ваши настройки ...
if ($block_xai) {
return 403;
}
}
Apache (.htaccess)
# Блокировка семейства xAI в .htaccess
<IfModule mod_rewrite.c>
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} GrokBot [NC,OR]
RewriteCond %{HTTP_USER_AGENT} xAI-Grok [NC,OR]
RewriteCond %{HTTP_USER_AGENT} xAI-Bot [NC]
RewriteRule .* - [F,L]
</IfModule>
# Альтернативный вариант через BrowserMatch
BrowserMatch "GrokBot" bad_bot
BrowserMatch "xAI-Grok" bad_bot
BrowserMatch "xAI-Bot" bad_bot
<Directory />
Order Allow,Deny
Allow from all
Deny from env=bad_bot
</Directory>
Ограничение скорости (rate limiting) вместо полной блокировки
Если полная блокировка нежелательна (например, из-за риска потери цитирований в DeepSearch), рекомендуем применять rate limiting:
# Nginx: ограничение для xAI-ботов до 10 запросов/мин
geo $xai_bot_zone {
default 0;
}
map $http_user_agent $xai_limit {
"~*GrokBot|xAI-Grok|xAI-Bot" 1;
default 0;
}
limit_req_zone $binary_remote_addr zone=xai_bots:10m rate=10r/m;
server {
location / {
if ($xai_limit) {
limit_req zone=xai_bots burst=5 nodelay;
}
# ... ваша конфигурация ...
}
}
Блокировка через pbnshield
В интерфейсе pbnshield перейдите в раздел управления ботами и создайте правило для User-Agent токенов GrokBot, xAI-Grok, xAI-Bot. Правило автоматически применится ко всем доменам в вашем аккаунте. Обратите внимание, что трафик xAI, маскирующийся под браузер, не будет перехвачен UA-фильтром — для его ограничения используйте поведенческий анализ pbnshield.
7. Сравнение с аналогичными ИИ-краулерами
| Параметр | GrokBot (xAI) | GPTBot (OpenAI) | ClaudeBot (Anthropic) | PerplexityBot |
|---|---|---|---|---|
| Официальная документация | ❌ Отсутствует | ✅ Подробная | ✅ Есть | ✅ Есть |
| Публикация IP-диапазонов | ❌ Нет | ✅ JSON-файл | ❌ Нет (намеренно) | ⚠️ Частично |
| Reverse DNS верификация | ❌ Нет | ✅ Есть | ❌ Нет | ⚠️ Ограничена |
| Соблюдение robots.txt | ⚠️ Непоследовательно | ✅ Да | ✅ Да | ⚠️ Нарушения зафиксированы |
| Спуфинг User-Agent | ✅ Зафиксирован | ❌ Нет | ❌ Нет | ✅ Зафиксирован (Cloudflare, 2025) |
| Реферальный трафик | ⚠️ Только DeepSearch | ⚠️ Только OAI-SearchBot | ⚠️ Только Claude-SearchBot | ✅ Да |
| Нагрузка на сервер | ⚠️ Высокая (в спайки) | ⚠️ Умеренная | ⚠️ Умеренная | ⚠️ Умеренная |
8. Стратегия управления: сводная таблица
| Тип сайта / ситуация | Рекомендуемая стратегия | Обоснование |
|---|---|---|
| Новостной сайт, блог, публичный контент | Разрешить Grok-Web, Grok-DeepSearch; заблокировать GrokBot/xAI-Grok | Потенциальные цитирования в DeepSearch без отдачи данных для обучения |
| Коммерческий сайт с закрытыми данными | Заблокировать всё семейство xAI на уровне сервера | Защита контента, не приносит реферального трафика |
| SaaS, веб-приложение | Rate limiting + блокировка тренировочных UA | Защита от нагрузки, допустимость цитирований |
| PBN / дорвеи | Заблокировать всё семейство xAI | Исключение нежелательного анализа |
| SEO-агентство, информационный портал | Разрешить всё семейство xAI | Максимальное присутствие в ответах Grok и DeepSearch |
Статья подготовлена командой Trafficfeil. Данные актуальны на август 2026 года. Поскольку xAI не публикует официальной документации для своих краулеров, часть сведений основана на наблюдениях сообщества вебмастеров и сторонних каталогов ботов. Всегда проверяйте актуальные UA-токены перед применением правил.