DeepSeekBot — краулер, который связывают с DeepSeek, китайской AI/LLM-компанией. В каталогах ботов его классифицируют как training / data collection crawl. Но прежде чем настраивать правила именно под этот токен, стоит знать: устойчивой подробной first-party документации и публичного IP JSON часто нет — и это не единственная неопределённость вокруг него.
Разногласие, о котором молчат многие гайды
Большинство источников описывают DeepSeekBot как обычного «задекларированного» AI-краулера с собственным UA-токеном — вроде GPTBot или ClaudeBot — и дают инструкции по robots.txt так, будто это устоявшийся стандарт. Но есть и противоположная, не менее авторитетная позиция: часть аналитиков прямо утверждает, что DeepSeek **не публикует отдельный идентификатор** для своего краулера вообще, и обход сайтов может идти анонимно — без токена, который в принципе можно было бы заблокировать через robots.txt. Один из специализированных каталогов ботов маркирует DeepSeekBot как «недокументированный агент» и честно признаёт: без официальной документации неясно, соблюдает ли он robots.txt, с какой частотой обходит сайты и как использует собранные данные. Практический вывод: не считайте правило User-agent: DeepSeekBot / Disallow: / гарантированной защитой. Если часть трафика DeepSeek действительно идёт без узнаваемого токена, такое правило в лучшем случае перехватывает только часть визитов.
Параметры
| Параметр | Значение |
|---|---|
| UA (типичный, по заявлениям части каталогов) | Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/bot) |
| Токен | DeepSeekBot (существование единого стабильного токена для всего трафика DeepSeek оспаривается частью источников) |
| Оператор | DeepSeek (по заявлениям каталогов) |
| IP-лист | ❌ Обычно нет официального feed |
| robots.txt | Заявляют/ожидают соблюдение; compliance не гарантирован, а для части трафика правило может вовсе не сработать из-за отсутствия единого UA |
Дополнительный контекст: не только технический вопрос
DeepSeek — компания, работающая под юрисдикцией китайского законодательства о данных, что создаёт иной профиль рисков по сравнению с краулерами американских компаний вроде OpenAI или Anthropic. Для организаций с требованиями по защите конфиденциальной информации, чувствительной интеллектуальной собственности или регуляторными обязательствами это может быть значимым фактором при принятии решения — независимо от того, насколько технически надёжна блокировка по UA.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil — порядка 4 тысяч запросов. Учитывая неопределённость с идентификацией трафика, эта цифра, вероятно, отражает только часть реального обхода — ту, что пришла с узнаваемым токеном.
Контроль
grep -i "DeepSeekBot" /var/log/nginx/access.log
User-agent: DeepSeekBot
Disallow: /
if ($http_user_agent ~* "DeepSeekBot") {
return 403;
}
Рекомендации
- Не хотите отдавать контент в training DeepSeek — Disallow + обязательно дублируйте на TrafficVeil/WAF, поскольку одного robots.txt может быть недостаточно
- Учитывая спорный статус официального UA, не полагайтесь только на UA-фильтр — по возможности добавьте поведенческий мониторинг (плотность запросов, отсутствие сессий) как дополнительный сигнал
- На позиции в Google блокировка не влияет
- UA легко подделать в обе стороны: как выдать себя за DeepSeekBot, так и скрыть реальный трафик под generic-строкой — не делайте резких выводов по одному совпадению токена
Частые вопросы
Публикует ли DeepSeek официальный UA-токен для своего краулера?
Гарантирует ли Disallow для DeepSeekBot полную защиту от обхода?
Почему юрисдикция DeepSeek имеет значение помимо технических аспектов блокировки?
Достаточно ли robots.txt для блокировки DeepSeekBot?
Влияет ли блокировка DeepSeekBot на позиции сайта в Google?
Что делать, если объём трафика от DeepSeekBot кажется заниженным?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.