Если фильтровать access.log по chatglm-spider, часто всплывает целый пласт машинных хитов — это и есть ChatGLM-Spider. Оператор здесь установлен точно: Zhipu AI (Beijing Zhipu Huazhang Technology Co., Ltd.) — китайская AI-компания, основанная в 2019 году, разработчик двуязычной (китайско-английской) серии больших языковых моделей ChatGLM. Краулер задокументирован на официальном сайте компании (zhipu.ai) и в открытых репозиториях на GitHub (github.com/THUDM), впервые был замечен примерно в середине 2023 года — одновременно с релизом ChatGLM-3.
1. Что такое ChatGLM-Spider
Задача краулера — сбор публично доступного веб-контента (статьи, форумы, документация) для тренировки и дообучения серии моделей ChatGLM, включая ChatGLM-4 и более ранние версии. По независимому анализу, у бота характерный неравномерный паттерн активности: трафик заметно возрастает на несколько недель, когда Zhipu AI готовит новую версию модели и собирает свежие данные, а затем стихает в промежутках между релизами — то есть резкий рост трафика от этого бота может напрямую совпадать с новостями о выходе очередной версии ChatGLM.
| Название | ChatGLM-Spider |
| User-Agent / паттерн | chatglm-spider — токен также встречается в вариациях написания вроде ChatGLM_Spider, ChatGLM.Spider |
| Оператор | Zhipu AI (Beijing Zhipu Huazhang Technology Co., Ltd.) — китайская AI-компания, с 2019 года, разработчик серии моделей ChatGLM |
| Роль | Собирает публичный веб-контент для тренировки и дообучения моделей ChatGLM; данные проходят дедупликацию, фильтрацию персональных данных и оценку качества перед включением в обучающий корпус |
| Документация / ориентир | zhipu.ai и открытые репозитории github.com/THUDM; по независимым данным компания публикует отчёт о прозрачности источников данных, но формального механизма опт-аута кроме robots.txt не предоставляет |
| Список IP | ❌ Официально подтверждённых диапазонов IP не публикуется — для более надёжной верификации, чем совпадение UA, рекомендуется обратный DNS-запрос |
| robots.txt | Официально поддерживается — Zhipu AI прямо рекомендует вебмастерам использовать блок User-agent: ChatGLM-Spider для полного исключения контента |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем ChatGLM-Spider приходит на сайт
Появление ChatGLM-Spider в access.log означает машинный доступ к сайту для пополнения тренировочного корпуса моделей ChatGLM — это не поисковый краулер и не user-initiated fetcher, а классический тренировочный AI-скрапер: систематический, широкий обход, а не точечные запросы по чьему-то запросу. Заявленная политика оператора — собранный текст используется для статистического языкового моделирования, а не сохраняется дословно как копия защищённого авторским правом контента, хотя формального опт-аута кроме robots.txt компания не предлагает.
- Какие зоны чаще трогает: публичные URL, иногда API и статику — обход систематический, а не выборочный;
- Что ищет: текстовый контент, пригодный для языкового моделирования — статьи, форумы, документацию;
- Чем отличается от браузерного пользователя: нет нормальной сессии, широкие сплошные обходы, концентрированные во времени вокруг циклов подготовки новых версий модели.
Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует chatglm-spider на пагинации и карточках. После rate-limit или запрета в TrafficVeil origin остывает, а SEO-роботы Google/Yandex продолжают ходить как обычно — но если всплеск совпал по времени с публичным анонсом новой версии ChatGLM, это, вероятно, не совпадение.
3. Нагрузка и риски именно для ChatGLM-Spider
Отдельной строки в публичной сводке top-bot TrafficVeil у chatglm-spider может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. По одному из источников, многопоточный параллельный обход этого краулера способен ощутимо нагружать небольшие сайты — упоминается рекомендуемый оператором лимит около 20 запросов в минуту на IP, хотя эту цифру стоит воспринимать как ориентир, а не подтверждённый официальный стандарт.
4. Как найти ChatGLM-Spider в логах
Не ищите «просто ботов» — ищите конкретный токен chatglm-spider и рядом смотрите соседей по семейству тренировочных AI-краулеров.
# Базовый поиск
grep -i "chatglm-spider" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — проверьте, не совпадает ли всплеск с релизом новой версии ChatGLM
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от похожих строк семейства тренировочных AI-краулеров
grep -iE "chatglm-spider|gptbot|claudebot|bytespider|ccbot" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP Zhipu AI не публикует, поэтому строка UA сама по себе — лишь подсказка, не доказательство. Для более надёжной проверки используйте обратный DNS-запрос, а не полагайтесь только на совпадение имени.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для ChatGLM-Spider
# Жёсткий запрет
User-agent: ChatGLM-Spider
Disallow: /
# Разрешить всё
User-agent: ChatGLM-Spider
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ChatGLM-Spider
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow для chatglm-spider, если пользы нет — это прямо задокументированный и официально рекомендованный самим оператором способ исключить контент из тренировочного корпуса. Если бот всё же продолжает обход после блокировки в robots.txt, переходите к rate-limit или полному запрету на уровне сервера, учитывая упоминаемую многопоточность обхода.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "chatglm-spider") {
return 403;
}
limit_req_zone $binary_remote_addr zone=chatglmspider:10m rate=10r/m;
location / {
if ($http_user_agent ~* "chatglm-spider") {
limit_req zone=chatglmspider burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} chatglm-spider [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите chatglm-spider в ботах домена или в /system/bots;
- Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit с учётом возможной многопоточности обхода;
- Allow только при явной пользе от ChatGLM-Spider — например, если вам важна видимость контента в китайскоязычной AI-экосистеме;
- После изменения сверьте логи: хиты ChatGLM-Spider должны уйти в блок или лимит, а нужные поисковики остаться.
7. Рекомендации: что делать с ChatGLM-Spider
- Если пользы нет — Disallow/403 для chatglm-spider, если пользы нет — это официально поддерживаемый оператором способ исключения из тренировочного корпуса;
- Если польза есть — Allow только при явной пользе от ChatGLM-Spider;
- Если нагрузка мешает — сначала rate-limit, затем полный запрет, учитывая упоминаемую многопоточность обхода;
- Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
- Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент — блокировка не влияет на индексацию в Google, Bing или Яндекс.
8. С кем не путать ChatGLM-Spider
| Бот / сосед | Кластер | UA | Комментарий |
| GPTBot | AI и LLM-краулеры | gptbot | другой оператор (OpenAI), аналогичная роль тренировочного краулера |
| ClaudeBot | AI и LLM-краулеры | claudebot | другой оператор (Anthropic) |
| Bytespider | AI и LLM-краулеры | bytespider | другой оператор (ByteDance), тоже китайская компания, но не связана с Zhipu AI |
| CCBot | AI и LLM-краулеры | ccbot | другой оператор (Common Crawl), открытый общий веб-корпус |
| DeepSeekBot | AI и LLM-краулеры | deepseekbot | другой оператор, ещё одна китайская AI-компания |
9. Стратегия allow/deny для ChatGLM-Spider
| Ситуация | Действие |
| Не хотите участвовать в тренировке ChatGLM | Disallow — официально поддерживаемый и рекомендованный оператором способ |
| Важна видимость в китайскоязычной AI-экосистеме | Allow, дополнительных мер не требуется |
| Нужен доступ, но многопоточный обход перегружает сервер | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Официальных IP нет — проверять через обратный DNS, не доверять только строке UA |