TrafficVeil
Боты 6 мин13 августа 2026 г.

ChatGLM-Spider в логах: тренировочный краулер китайской ChatGLM

Разбираем ChatGLM-Spider — краулер компании Zhipu AI для тренировки моделей ChatGLM. Показываем характерный паттерн активности, привязанный к релизам новых версий модели, и как настроить allow/deny через официально рекомендованное правило robots.txt.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое ChatGLM-Spider
  2. 2. Зачем ChatGLM-Spider приходит на сайт
  3. 3. Нагрузка и риски именно для ChatGLM-Spider
  4. 4. Как найти ChatGLM-Spider в логах
  5. 5. robots.txt для ChatGLM-Spider
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с ChatGLM-Spider
  8. 8. С кем не путать ChatGLM-Spider
  9. 9. Стратегия allow/deny для ChatGLM-Spider
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Если фильтровать access.log по chatglm-spider, часто всплывает целый пласт машинных хитов — это и есть ChatGLM-Spider. Оператор здесь установлен точно: Zhipu AI (Beijing Zhipu Huazhang Technology Co., Ltd.) — китайская AI-компания, основанная в 2019 году, разработчик двуязычной (китайско-английской) серии больших языковых моделей ChatGLM. Краулер задокументирован на официальном сайте компании (zhipu.ai) и в открытых репозиториях на GitHub (github.com/THUDM), впервые был замечен примерно в середине 2023 года — одновременно с релизом ChatGLM-3.

1. Что такое ChatGLM-Spider

Задача краулера — сбор публично доступного веб-контента (статьи, форумы, документация) для тренировки и дообучения серии моделей ChatGLM, включая ChatGLM-4 и более ранние версии. По независимому анализу, у бота характерный неравномерный паттерн активности: трафик заметно возрастает на несколько недель, когда Zhipu AI готовит новую версию модели и собирает свежие данные, а затем стихает в промежутках между релизами — то есть резкий рост трафика от этого бота может напрямую совпадать с новостями о выходе очередной версии ChatGLM.

Название ChatGLM-Spider
User-Agent / паттерн chatglm-spider — токен также встречается в вариациях написания вроде ChatGLM_Spider, ChatGLM.Spider
Оператор Zhipu AI (Beijing Zhipu Huazhang Technology Co., Ltd.) — китайская AI-компания, с 2019 года, разработчик серии моделей ChatGLM
Роль Собирает публичный веб-контент для тренировки и дообучения моделей ChatGLM; данные проходят дедупликацию, фильтрацию персональных данных и оценку качества перед включением в обучающий корпус
Документация / ориентир zhipu.ai и открытые репозитории github.com/THUDM; по независимым данным компания публикует отчёт о прозрачности источников данных, но формального механизма опт-аута кроме robots.txt не предоставляет
Список IP ❌ Официально подтверждённых диапазонов IP не публикуется — для более надёжной верификации, чем совпадение UA, рекомендуется обратный DNS-запрос
robots.txt Официально поддерживается — Zhipu AI прямо рекомендует вебмастерам использовать блок User-agent: ChatGLM-Spider для полного исключения контента
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем ChatGLM-Spider приходит на сайт

Появление ChatGLM-Spider в access.log означает машинный доступ к сайту для пополнения тренировочного корпуса моделей ChatGLM — это не поисковый краулер и не user-initiated fetcher, а классический тренировочный AI-скрапер: систематический, широкий обход, а не точечные запросы по чьему-то запросу. Заявленная политика оператора — собранный текст используется для статистического языкового моделирования, а не сохраняется дословно как копия защищённого авторским правом контента, хотя формального опт-аута кроме robots.txt компания не предлагает.

  • Какие зоны чаще трогает: публичные URL, иногда API и статику — обход систематический, а не выборочный;
  • Что ищет: текстовый контент, пригодный для языкового моделирования — статьи, форумы, документацию;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, широкие сплошные обходы, концентрированные во времени вокруг циклов подготовки новых версий модели.

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует chatglm-spider на пагинации и карточках. После rate-limit или запрета в TrafficVeil origin остывает, а SEO-роботы Google/Yandex продолжают ходить как обычно — но если всплеск совпал по времени с публичным анонсом новой версии ChatGLM, это, вероятно, не совпадение.

3. Нагрузка и риски именно для ChatGLM-Spider

Отдельной строки в публичной сводке top-bot TrafficVeil у chatglm-spider может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. По одному из источников, многопоточный параллельный обход этого краулера способен ощутимо нагружать небольшие сайты — упоминается рекомендуемый оператором лимит около 20 запросов в минуту на IP, хотя эту цифру стоит воспринимать как ориентир, а не подтверждённый официальный стандарт.

4. Как найти ChatGLM-Spider в логах

Не ищите «просто ботов» — ищите конкретный токен chatglm-spider и рядом смотрите соседей по семейству тренировочных AI-краулеров.

# Базовый поиск
grep -i "chatglm-spider" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность — проверьте, не совпадает ли всплеск с релизом новой версии ChatGLM
grep -i "chatglm-spider" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от похожих строк семейства тренировочных AI-краулеров
grep -iE "chatglm-spider|gptbot|claudebot|bytespider|ccbot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP Zhipu AI не публикует, поэтому строка UA сама по себе — лишь подсказка, не доказательство. Для более надёжной проверки используйте обратный DNS-запрос, а не полагайтесь только на совпадение имени.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для ChatGLM-Spider

# Жёсткий запрет
User-agent: ChatGLM-Spider
Disallow: /

# Разрешить всё
User-agent: ChatGLM-Spider
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: ChatGLM-Spider
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow для chatglm-spider, если пользы нет — это прямо задокументированный и официально рекомендованный самим оператором способ исключить контент из тренировочного корпуса. Если бот всё же продолжает обход после блокировки в robots.txt, переходите к rate-limit или полному запрету на уровне сервера, учитывая упоминаемую многопоточность обхода.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "chatglm-spider") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=chatglmspider:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "chatglm-spider") {
        limit_req zone=chatglmspider burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} chatglm-spider [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите chatglm-spider в ботах домена или в /system/bots;
  • Для нежелательного сценария — категорию «запретить»; для мягкого — rate-limit с учётом возможной многопоточности обхода;
  • Allow только при явной пользе от ChatGLM-Spider — например, если вам важна видимость контента в китайскоязычной AI-экосистеме;
  • После изменения сверьте логи: хиты ChatGLM-Spider должны уйти в блок или лимит, а нужные поисковики остаться.

7. Рекомендации: что делать с ChatGLM-Spider

  • Если пользы нет — Disallow/403 для chatglm-spider, если пользы нет — это официально поддерживаемый оператором способ исключения из тренировочного корпуса;
  • Если польза есть — Allow только при явной пользе от ChatGLM-Spider;
  • Если нагрузка мешает — сначала rate-limit, затем полный запрет, учитывая упоминаемую многопоточность обхода;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете, если это не поисковик и не ваш сервисный агент — блокировка не влияет на индексацию в Google, Bing или Яндекс.

8. С кем не путать ChatGLM-Spider

Бот / сосед Кластер UA Комментарий
GPTBot AI и LLM-краулеры gptbot другой оператор (OpenAI), аналогичная роль тренировочного краулера
ClaudeBot AI и LLM-краулеры claudebot другой оператор (Anthropic)
Bytespider AI и LLM-краулеры bytespider другой оператор (ByteDance), тоже китайская компания, но не связана с Zhipu AI
CCBot AI и LLM-краулеры ccbot другой оператор (Common Crawl), открытый общий веб-корпус
DeepSeekBot AI и LLM-краулеры deepseekbot другой оператор, ещё одна китайская AI-компания

9. Стратегия allow/deny для ChatGLM-Spider

Ситуация Действие
Не хотите участвовать в тренировке ChatGLM Disallow — официально поддерживаемый и рекомендованный оператором способ
Важна видимость в китайскоязычной AI-экосистеме Allow, дополнительных мер не требуется
Нужен доступ, но многопоточный обход перегружает сервер Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Официальных IP нет — проверять через обратный DNS, не доверять только строке UA

Частые вопросы

ChatGLM-Spider — это поисковый краулер?

Нет, это тренировочный AI-скрапер компании Zhipu AI, который собирает контент для обучения языковых моделей ChatGLM, а не для поисковой индексации.

Почему трафик от этого бота иногда резко растёт?

По независимым наблюдениям, активность заметно усиливается на несколько недель, когда Zhipu AI готовит новую версию модели, а затем стихает между релизами — рост может совпадать с анонсами ChatGLM.

Есть ли официальный способ исключить контент из тренировки?

Да, Zhipu AI прямо рекомендует использовать блок User-agent: ChatGLM-Spider в robots.txt для полного исключения — это официальная, а не предполагаемая позиция оператора.

Публикует ли Zhipu AI список IP-адресов краулера?

Нет, официально подтверждённых диапазонов не найдено, поэтому для более надёжной проверки рекомендуется обратный DNS-запрос, а не только совпадение строки UA.

Может ли этот краулер сильно нагрузить небольшой сайт?

Да, по одному из источников, многопоточный параллельный обход способен ощутимо нагружать небольшие сайты — стоит учитывать это при выборе между rate-limit и полной блокировкой.

Влияет ли блокировка ChatGLM-Spider на позиции сайта в поиске?

Нет, это не связано с классической поисковой индексацией, поэтому блокировка не отражается на позициях в Google, Bing или Яндекс.

#ChatGLM-Spider#Zhipu AI#ChatGLM#AI-краулеры#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.