TrafficVeil
Боты 6 мин25 августа 2026 г.

PanguBot: краулер Huawei для обучения AI-модели

PanguBot — официально задокументированный краулер Huawei, который скачивает контент для обучения мультимодальной LLM PanGu. Разбираем реальное назначение бота, отличие от поискового PetalBot той же компании и настройку блокировки через robots.txt и TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое PanguBot на самом деле
  2. Зачем PanguBot приходит на сайт
  3. Нагрузка и риски именно для PanguBot
  4. Как найти PanguBot в логах
  5. robots.txt для PanguBot
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать PanguBot
  11. Стратегия allow/deny для PanguBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

PanguBot — не безымянный «автоматизированный краулер с неясной целью», а официально задокументированный AI-краулер компании Huawei. Его задача прямая и подтверждённая: скачивать общедоступный веб-контент для обучения мультимодальной языковой модели PanGu — собственной большой модели Huawei, способной работать с текстом, изображениями и другими типами данных. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».

Что такое PanguBot на самом деле

PanguBot принадлежит Huawei — крупной китайской технологической компании — и служит инструментом сбора обучающих данных именно для модели PanGu (название отражает масштаб модели — свыше 100 миллиардов параметров). В отличие от классических поисковых краулеров, которые индексируют контент для последующей выдачи пользователям, PanguBot архитектурно заточен под сбор разнородных данных для машинного обучения — с особым интересом к мультимедийному контенту и страницам с высокой информационной плотностью.

Важно не путать PanguBot с другим ботом Huawei — PetalBot, который занимается индексацией сайтов для поискового сервиса Petal Search и AI-рекомендаций Huawei Assistant. Это два разных бота с разными задачами, хотя оба принадлежат одной компании.

Параметр Значение
Название PanguBot
User-Agent / паттерн pangubot (стандартизированная строка PanguBot в заголовках HTTP)
Оператор Huawei (китайская технологическая компания)
Роль Скачивание общедоступного веб-контента для обучения мультимодальной LLM PanGu
Документация / ориентир Оператор задокументирован в нескольких открытых каталогах ботов; официальный список изменений публикуется не всегда прозрачно
Список IP ❌ Отдельного полного публичного списка не обнаружено; проверяйте ASN и не доверяйте только строке UA
robots.txt Официально подтверждённое правило существует: User-agent: PanguBot / Disallow: /
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

Зачем PanguBot приходит на сайт

Бот демонстрирует несколько характерных поведенческих паттернов: предпочтение мультимедийному контенту, частые визиты на сайты с высокой информационной плотностью, а также периодический повторный обход, ориентированный на отслеживание инкрементальных обновлений контента, а не на полное архивирование сайта заново при каждом визите. Частота визитов, по наблюдениям, зависит от качества и частоты обновления контента — сайты с регулярно обновляемым, содержательным материалом посещаются активнее.

Как и у большинства AI data scraper-ов, паттерны выбора сайтов и приоритетов у Huawei публично не раскрываются — компания не объясняет, почему выбран именно ваш домен и с какой периодичностью планируется его обходить.

Нагрузка и риски именно для PanguBot

Отдельной строки в публичной сводке топ-ботов TrafficVeil у pangubot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на:

  • предпочтение мультимедийным файлам — если бот активно вычитывает изображения и другой тяжёлый контент, это соответствует его профилю;
  • периодические повторные визиты, ориентированные на инкрементальные изменения, а не единичный полный обход;
  • отсутствие cookie и признаков сессии.

Как найти PanguBot в логах

Ищите конкретный токен pangubot, а не общее слово «bot».

# Базовый поиск
grep -i "pangubot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация: подделать User-Agent может любой скрипт. Для критичных решений дополнительно проверяйте IP/ASN, частоту и path-паттерны — концентрация на мультимедийных файлах и содержательных страницах хорошо согласуется с заявленным профилем бота:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для PanguBot

# Жёсткий запрет
User-agent: pangubot
Disallow: /

# Разрешить всё
User-agent: pangubot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: pangubot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

В отличие от многих недокументированных ботов в этой категории, для PanguBot существует официально подтверждённое правило блокировки — это делает robots.txt рабочим первым рубежом контроля, хотя для гарантии стоит дополнительно проверять поведение по факту логов.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "pangubot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=pangubot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "pangubot") {
        limit_req zone=pangubot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} pangubot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите pangubot / PanguBot в ботах домена или в /system/bots;
  • для нежелательного сценария — категория «запретить»; для мягкого — rate-limit;
  • allow оставляйте только при осознанном решении разрешить использование контента для обучения модели PanGu;
  • после изменения сверьте логи: хиты PanguBot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать PanguBot

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

Отдельно стоит помнить про PetalBot — другой краулер Huawei, отвечающий за поисковую индексацию для Petal Search, а не за сбор обучающих данных. Решение по этим двум ботам стоит принимать независимо друг от друга.

Стратегия allow/deny для PanguBot

Ситуация Действие
Использование контента для обучения PanGu нежелательно Disallow + запрет в TrafficVeil
Присутствие в обучающих данных модели не критично Allow + закрыть /admin /cart /api
Обход в целом приемлем, но нагрузка от мультимедийного контента избыточна Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на спуфинг UA Не доверять строке UA; смотреть IP/ASN и поведение — соответствие профилю мультимедийного сбора

Главный вывод по PanguBot: это классический пример AI-краулера для обучения моделей — прозрачно задокументированный по назначению, но, как и у большинства подобных ботов, непрозрачный по критериям выбора сайтов и частоте обхода. Решение allow/deny здесь стоит принимать так же, как для любого другого data scraper-а, собирающего обучающие данные без явной отдачи сайту-источнику.

Частые вопросы

Для чего именно Huawei использует данные, которые собирает PanguBot?

Для обучения собственной мультимодальной языковой модели PanGu, способной обрабатывать текст, изображения и другие типы данных.

Чем PanguBot отличается от другого краулера Huawei — PetalBot?

PetalBot индексирует сайты для поискового сервиса Petal Search, а PanguBot занимается исключительно сбором обучающих данных для AI-модели — это два разных бота с разными задачами.

Какой тип контента предпочитает PanguBot при обходе сайтов?

Мультимедийный контент и страницы с высокой информационной плотностью — это отражает его архитектуру, заточенную под сбор данных для машинного обучения.

Существует ли официально подтверждённое правило robots.txt для блокировки PanguBot?

Да, подтверждённое правило User-agent: PanguBot / Disallow: / существует, что делает файл рабочим первым рубежом контроля.

Раскрывает ли Huawei критерии выбора сайтов и частоту обхода PanguBot?

Нет — как и у большинства AI data scraper-ов, эти паттерны публично не разглашаются оператором.

Как отличить обычный полный обход сайта от типичного поведения PanguBot?

По периодическим повторным визитам, ориентированным на отслеживание инкрементальных изменений, а не на полное архивирование сайта заново при каждом визите.

#PanguBot#Huawei#AI-краулеры#обучение моделей#боты на сайте#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Simplified AI: бот крупного сервиса контент-маркетинга

Simplified AI — не безымянный стартап, а популярный сервис для генерации текстов, дизайна и видео с миллионами пользователей. Разбираем правдоподобную причину визитов бота, как найти его в логах и настроить allow, rate-limit или блокировку через TrafficVeil.

5 мин

W3C CSS Validator: инструмент, а не автономный обход

W3C_CSS_Validator — официальный публичный сервис консорциума W3C, который делает запрос только когда человек вручную запустил проверку CSS через форму валидатора. Разбираем известный риск спуфинга под этот UA и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Trae: AI-агент ByteDance для разработчиков

Trae — официально задокументированный AI-агент для разработки от ByteDance, чьи fetch-запросы инициирует конкретный разработчик в процессе работы с кодом, а не системный обход сайта. Разбираем сходство с OpenCode и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

PanguBot: краулер Huawei для обучения PanGu