Важно сразу разграничить: ClaudeBot отвечает только за обучение моделей. Он не участвует в построении поискового индекса Claude (это делает Claude-SearchBot) и не обрабатывает запросы, инициированные пользователем в моменте (за это отвечает Claude-User). Все три бота настраиваются в robots.txt независимо друг от друга.
1. Что такое ClaudeBot
| Параметр | Значение |
|---|---|
| User-Agent (токен) | ClaudeBot |
| Полная строка UA | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) |
| Оператор | Anthropic |
| Назначение | Сбор публичного веб-контента для обучения и улучшения моделей Claude |
| Официальная документация | Claude Help Center — «Does Anthropic crawl data from the web...» |
| Список IP-адресов | ❌ Официально не публикуется |
| Соблюдение robots.txt | Да, официально подтверждено, включая нестандартную директиву Crawl-delay |
| Обходит CAPTCHA и антибот-защиту | Нет — Anthropic официально заявляет об уважении anti-circumvention технологий |
| Предшественники (задеприкейчены) | Claude-Web, anthropic-ai |
Блокировка ClaudeBot означает, что будущий контент сайта не должен использоваться при обучении моделей Claude. Ключевое слово — «будущий»: блокировка не удаляет ранее собранный и уже использованный в обучении контент, она лишь исключает сайт из последующих циклов сбора данных.
2. Как работает ClaudeBot
- Проактивно обходит публично доступные страницы сайта, аналогично классическим поисковым краулерам;
- Учитывает как стандартную директиву Disallow, так и нестандартную Crawl-delay, позволяющую задать минимальный интервал между запросами;
- Не пытается обходить CAPTCHA или другие технологии защиты от автоматического доступа;
- Работает с публичных облачных IP-адресов провайдеров — то есть не имеет выделенного, постоянного диапазона, который можно однозначно заблокировать по IP.
3. Нагрузка на сервер
По данным мониторинга bot-трафика trafficveil (ClickHouse, 696 доменов, 161 уникальный бот, март–июнь 2026) краулеры категории «обучение моделей», включая ClaudeBot, как правило, не относятся к числу самых агрессивных по объёму запросов на конкретный сайт — заметно больший вклад в общую нагрузку исторически вносят краулеры вроде Meta ExternalAgent или Bytespider. Тем не менее сама природа обучающего краулера — полный периодический обход сайта — делает суммарный трафик значимым на крупных сайтах с большим числом страниц.
4. Обнаружение в логах
Поиск по User-Agent
# Все запросы от ClaudeBot
grep "ClaudeBot" /var/log/nginx/access.log
# Количество запросов за сегодня
grep "ClaudeBot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l
# Уникальные IP-адреса
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $1}' | sort -u
# Топ сканируемых разделов
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20
Верификация — почему IP-блокировка здесь не работает как обычно
В отличие от GPTBot, OAI-SearchBot или Googlebot, Anthropic официально не публикует список IP-адресов своих ботов и прямо предупреждает: её боты используют публичные IP-адреса облачных провайдеров, поэтому блокировка этих диапазонов может помешать боту прочитать сам файл robots.txt — то есть привести к обратному эффекту (бот продолжит сканирование без учёта директив, потому что не смог их получить).
# Проверка через reverse DNS — вспомогательный, не окончательный метод
# (официального списка IP от Anthropic нет, поэтому это лишь косвенный сигнал)
IP="1.2.3.4"
dig +short -x "$IP"
#!/bin/bash
# Логирование запросов ClaudeBot для собственного анализа паттерна поведения,
# так как IP-верификация против официального списка недоступна
LOG_FILE="/var/log/nginx/access.log"
echo "IP-адрес | Кол-во запросов | Reverse DNS"
echo "-------------------------------------------"
grep "ClaudeBot" "$LOG_FILE" | awk '{print $1}' | sort | uniq -c | sort -rn | while read count ip; do
ptr=$(dig +short -x "$ip" 2>/dev/null)
ptr=${ptr:-"нет PTR-записи"}
echo "$ip | $count | $ptr"
done
Официальная рекомендация Anthropic при подозрении на некорректное поведение бота — писать напрямую на claudebot@anthropic.com с указанием домена, а не пытаться блокировать по IP.
5. robots.txt
# Полная блокировка обучающего краулера
User-agent: ClaudeBot
Disallow: /
# Ограничение частоты вместо полной блокировки
User-agent: ClaudeBot
Crawl-delay: 1
# Блокировка только части сайта
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /internal/
Allow: /
# Полный разрешающий доступ
User-agent: ClaudeBot
Allow: /
Правило для ClaudeBot не распространяется на Claude-User и Claude-SearchBot — для полного исключения из экосистемы Claude нужны отдельные директивы для каждого токена.
6. Управление на уровне сервера
Nginx
if ($http_user_agent ~* "ClaudeBot") {
return 403;
}
# Мягкий вариант — ограничение частоты вместо полной блокировки
limit_req_zone $binary_remote_addr zone=claudebot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "ClaudeBot") {
limit_req zone=claudebot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ClaudeBot [NC]
RewriteRule ^ - [F,L]
Важно: не дублируйте эту блокировку на уровне сетевого firewall по IP-диапазонам облачных провайдеров — это может задеть множество не связанных с Anthropic сервисов, работающих на тех же общих IP.
7. Рекомендации по оптимизации
- Решение по ClaudeBot — это решение только про обучение: блокировка не влияет на видимость в поиске Claude (Claude-SearchBot) и на доступность страниц по прямым пользовательским запросам (Claude-User);
- Не используйте IP-блокировку как основной метод — Anthropic прямо предупреждает, что это может помешать боту прочитать сам robots.txt;
- Используйте Crawl-delay, если цель — снизить нагрузку, а не закрыть доступ полностью — Anthropic официально поддерживает эту директиву;
- Учитывайте необратимость обучения: блокировка не удаляет уже собранный и использованный в обучении контент, действует только на будущее сканирование;
- При подозрении на некорректное поведение бота — пишите на claudebot@anthropic.com с указанием домена, а не полагайтесь на самостоятельную диагностику по IP.
8. Сравнение с похожими ботами
| Бот | Оператор | Назначение | Список IP |
|---|---|---|---|
| ClaudeBot | Anthropic | Обучение моделей | ❌ Нет |
| Claude-SearchBot | Anthropic | Поисковый индекс Claude | ❌ Нет |
| Claude-User | Anthropic | Пользовательские запросы в моменте | ❌ Нет |
| GPTBot | OpenAI | Обучение моделей | ✅ Есть |
| Google-Extended | Обучение Gemini | ✅ Есть (диапазоны Googlebot) | |
| CCBot | Common Crawl | Открытый датасет для обучения | ✅ Есть |
9. Сводная таблица стратегии
| Цель сайта | Рекомендация |
|---|---|
| Не хочу, чтобы контент использовался для обучения Claude | Disallow для ClaudeBot; Claude-User и Claude-SearchBot можно оставить открытыми |
| Хочу снизить нагрузку, но не блокировать полностью | Crawl-delay в правиле для ClaudeBot |
| Хочу максимальную видимость в экосистеме Claude | Allow для всех трёх агентов: ClaudeBot, Claude-User, Claude-SearchBot |
| В robots.txt остались правила для Claude-Web / anthropic-ai | Заменить на актуальный токен ClaudeBot — старые токены задеприкейчены |