PanguBot — не безымянный «автоматизированный краулер с неясной целью», а официально задокументированный AI-краулер компании Huawei. Его задача прямая и подтверждённая: скачивать общедоступный веб-контент для обучения мультимодальной языковой модели PanGu — собственной большой модели Huawei, способной работать с текстом, изображениями и другими типами данных. В каталоге TrafficVeil бот помечен как нежелательный в категории «Прочие краулеры и сервисы».
Что такое PanguBot на самом деле
PanguBot принадлежит Huawei — крупной китайской технологической компании — и служит инструментом сбора обучающих данных именно для модели PanGu (название отражает масштаб модели — свыше 100 миллиардов параметров). В отличие от классических поисковых краулеров, которые индексируют контент для последующей выдачи пользователям, PanguBot архитектурно заточен под сбор разнородных данных для машинного обучения — с особым интересом к мультимедийному контенту и страницам с высокой информационной плотностью.
Важно не путать PanguBot с другим ботом Huawei — PetalBot, который занимается индексацией сайтов для поискового сервиса Petal Search и AI-рекомендаций Huawei Assistant. Это два разных бота с разными задачами, хотя оба принадлежат одной компании.
| Параметр | Значение |
| Название | PanguBot |
| User-Agent / паттерн | pangubot (стандартизированная строка PanguBot в заголовках HTTP) |
| Оператор | Huawei (китайская технологическая компания) |
| Роль | Скачивание общедоступного веб-контента для обучения мультимодальной LLM PanGu |
| Документация / ориентир | Оператор задокументирован в нескольких открытых каталогах ботов; официальный список изменений публикуется не всегда прозрачно |
| Список IP | ❌ Отдельного полного публичного списка не обнаружено; проверяйте ASN и не доверяйте только строке UA |
| robots.txt | Официально подтверждённое правило существует: User-agent: PanguBot / Disallow: / |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
Зачем PanguBot приходит на сайт
Бот демонстрирует несколько характерных поведенческих паттернов: предпочтение мультимедийному контенту, частые визиты на сайты с высокой информационной плотностью, а также периодический повторный обход, ориентированный на отслеживание инкрементальных обновлений контента, а не на полное архивирование сайта заново при каждом визите. Частота визитов, по наблюдениям, зависит от качества и частоты обновления контента — сайты с регулярно обновляемым, содержательным материалом посещаются активнее.
Как и у большинства AI data scraper-ов, паттерны выбора сайтов и приоритетов у Huawei публично не раскрываются — компания не объясняет, почему выбран именно ваш домен и с какой периодичностью планируется его обходить.
Нагрузка и риски именно для PanguBot
Отдельной строки в публичной сводке топ-ботов TrafficVeil у pangubot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без единой конверсии. Смотрите не только на абсолютный RPS, но и на:
- предпочтение мультимедийным файлам — если бот активно вычитывает изображения и другой тяжёлый контент, это соответствует его профилю;
- периодические повторные визиты, ориентированные на инкрементальные изменения, а не единичный полный обход;
- отсутствие cookie и признаков сессии.
Как найти PanguBot в логах
Ищите конкретный токен pangubot, а не общее слово «bot».
# Базовый поиск
grep -i "pangubot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "pangubot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация: подделать User-Agent может любой скрипт. Для критичных решений дополнительно проверяйте IP/ASN, частоту и path-паттерны — концентрация на мультимедийных файлах и содержательных страницах хорошо согласуется с заявленным профилем бота:
IP="1.2.3.4" whois -h whois.cymru.com " -v $IP" dig +short -x "$IP"
robots.txt для PanguBot
# Жёсткий запрет User-agent: pangubot Disallow: / # Разрешить всё User-agent: pangubot Allow: / # Компромисс: закрыть деньги/кабинет, оставить публичную часть User-agent: pangubot Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /api/ Allow: /
В отличие от многих недокументированных ботов в этой категории, для PanguBot существует официально подтверждённое правило блокировки — это делает robots.txt рабочим первым рубежом контроля, хотя для гарантии стоит дополнительно проверять поведение по факту логов.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "pangubot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=pangubot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "pangubot") {
limit_req zone=pangubot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} pangubot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- найдите pangubot / PanguBot в ботах домена или в
/system/bots; - для нежелательного сценария — категория «запретить»; для мягкого — rate-limit;
- allow оставляйте только при осознанном решении разрешить использование контента для обучения модели PanGu;
- после изменения сверьте логи: хиты PanguBot должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.
С кем не путать PanguBot
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
Отдельно стоит помнить про PetalBot — другой краулер Huawei, отвечающий за поисковую индексацию для Petal Search, а не за сбор обучающих данных. Решение по этим двум ботам стоит принимать независимо друг от друга.
Стратегия allow/deny для PanguBot
| Ситуация | Действие |
| Использование контента для обучения PanGu нежелательно | Disallow + запрет в TrafficVeil |
| Присутствие в обучающих данных модели не критично | Allow + закрыть /admin /cart /api |
| Обход в целом приемлем, но нагрузка от мультимедийного контента избыточна | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на спуфинг UA | Не доверять строке UA; смотреть IP/ASN и поведение — соответствие профилю мультимедийного сбора |
Главный вывод по PanguBot: это классический пример AI-краулера для обучения моделей — прозрачно задокументированный по назначению, но, как и у большинства подобных ботов, непрозрачный по критериям выбора сайтов и частоте обхода. Решение allow/deny здесь стоит принимать так же, как для любого другого data scraper-а, собирающего обучающие данные без явной отдачи сайту-источнику.