Боты5 мин чтения·21 июля 2026 г.·обновлено 22 июля 2026 г.

ClaudeBot

ClaudeBot — основной краулер Anthropic, который собирает публично доступный веб-контент для обучения и улучшения генеративных моделей семейства Claude. Это самый узнаваемый и старый из трёх официально задокументированных ботов Anthropic, находящийся в центре большей части публичной дискуссии об AI-краулерах — в том числе из-за нашумевших данных Cloudflare о крайне высоком соотношении «сканирование / переходы по ссылкам» у AI-краулеров в целом.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ClaudeBot: нежелательный ai и llm-краулеры

Важно сразу разграничить: ClaudeBot отвечает только за обучение моделей. Он не участвует в построении поискового индекса Claude (это делает Claude-SearchBot) и не обрабатывает запросы, инициированные пользователем в моменте (за это отвечает Claude-User). Все три бота настраиваются в robots.txt независимо друг от друга.

1. Что такое ClaudeBot

Параметр Значение
User-Agent (токен) ClaudeBot
Полная строка UA Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
Оператор Anthropic
Назначение Сбор публичного веб-контента для обучения и улучшения моделей Claude
Официальная документация Claude Help Center — «Does Anthropic crawl data from the web...»
Список IP-адресов ❌ Официально не публикуется
Соблюдение robots.txt Да, официально подтверждено, включая нестандартную директиву Crawl-delay
Обходит CAPTCHA и антибот-защиту Нет — Anthropic официально заявляет об уважении anti-circumvention технологий
Предшественники (задеприкейчены) Claude-Web, anthropic-ai

Блокировка ClaudeBot означает, что будущий контент сайта не должен использоваться при обучении моделей Claude. Ключевое слово — «будущий»: блокировка не удаляет ранее собранный и уже использованный в обучении контент, она лишь исключает сайт из последующих циклов сбора данных.

2. Как работает ClaudeBot

  • Проактивно обходит публично доступные страницы сайта, аналогично классическим поисковым краулерам;
  • Учитывает как стандартную директиву Disallow, так и нестандартную Crawl-delay, позволяющую задать минимальный интервал между запросами;
  • Не пытается обходить CAPTCHA или другие технологии защиты от автоматического доступа;
  • Работает с публичных облачных IP-адресов провайдеров — то есть не имеет выделенного, постоянного диапазона, который можно однозначно заблокировать по IP.

3. Нагрузка на сервер

По данным мониторинга bot-трафика trafficveil (ClickHouse, 696 доменов, 161 уникальный бот, март–июнь 2026) краулеры категории «обучение моделей», включая ClaudeBot, как правило, не относятся к числу самых агрессивных по объёму запросов на конкретный сайт — заметно больший вклад в общую нагрузку исторически вносят краулеры вроде Meta ExternalAgent или Bytespider. Тем не менее сама природа обучающего краулера — полный периодический обход сайта — делает суммарный трафик значимым на крупных сайтах с большим числом страниц.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Обнаружение в логах

Поиск по User-Agent

# Все запросы от ClaudeBot
grep "ClaudeBot" /var/log/nginx/access.log

# Количество запросов за сегодня
grep "ClaudeBot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP-адреса
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Топ сканируемых разделов
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Верификация — почему IP-блокировка здесь не работает как обычно

В отличие от GPTBot, OAI-SearchBot или Googlebot, Anthropic официально не публикует список IP-адресов своих ботов и прямо предупреждает: её боты используют публичные IP-адреса облачных провайдеров, поэтому блокировка этих диапазонов может помешать боту прочитать сам файл robots.txt — то есть привести к обратному эффекту (бот продолжит сканирование без учёта директив, потому что не смог их получить).

# Проверка через reverse DNS — вспомогательный, не окончательный метод
# (официального списка IP от Anthropic нет, поэтому это лишь косвенный сигнал)
IP="1.2.3.4"
dig +short -x "$IP"
#!/bin/bash
# Логирование запросов ClaudeBot для собственного анализа паттерна поведения,
# так как IP-верификация против официального списка недоступна
LOG_FILE="/var/log/nginx/access.log"

echo "IP-адрес | Кол-во запросов | Reverse DNS"
echo "-------------------------------------------"

grep "ClaudeBot" "$LOG_FILE" | awk '{print $1}' | sort | uniq -c | sort -rn | while read count ip; do
    ptr=$(dig +short -x "$ip" 2>/dev/null)
    ptr=${ptr:-"нет PTR-записи"}
    echo "$ip | $count | $ptr"
done

Официальная рекомендация Anthropic при подозрении на некорректное поведение бота — писать напрямую на claudebot@anthropic.com с указанием домена, а не пытаться блокировать по IP.

5. robots.txt

# Полная блокировка обучающего краулера
User-agent: ClaudeBot
Disallow: /

# Ограничение частоты вместо полной блокировки
User-agent: ClaudeBot
Crawl-delay: 1

# Блокировка только части сайта
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /internal/
Allow: /

# Полный разрешающий доступ
User-agent: ClaudeBot
Allow: /

Правило для ClaudeBot не распространяется на Claude-User и Claude-SearchBot — для полного исключения из экосистемы Claude нужны отдельные директивы для каждого токена.

6. Управление на уровне сервера

Nginx

if ($http_user_agent ~* "ClaudeBot") {
    return 403;
}

# Мягкий вариант — ограничение частоты вместо полной блокировки
limit_req_zone $binary_remote_addr zone=claudebot:10m rate=10r/m;

location / {
    if ($http_user_agent ~* "ClaudeBot") {
        limit_req zone=claudebot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ClaudeBot [NC]
RewriteRule ^ - [F,L]

Важно: не дублируйте эту блокировку на уровне сетевого firewall по IP-диапазонам облачных провайдеров — это может задеть множество не связанных с Anthropic сервисов, работающих на тех же общих IP.

7. Рекомендации по оптимизации

  • Решение по ClaudeBot — это решение только про обучение: блокировка не влияет на видимость в поиске Claude (Claude-SearchBot) и на доступность страниц по прямым пользовательским запросам (Claude-User);
  • Не используйте IP-блокировку как основной метод — Anthropic прямо предупреждает, что это может помешать боту прочитать сам robots.txt;
  • Используйте Crawl-delay, если цель — снизить нагрузку, а не закрыть доступ полностью — Anthropic официально поддерживает эту директиву;
  • Учитывайте необратимость обучения: блокировка не удаляет уже собранный и использованный в обучении контент, действует только на будущее сканирование;
  • При подозрении на некорректное поведение бота — пишите на claudebot@anthropic.com с указанием домена, а не полагайтесь на самостоятельную диагностику по IP.

8. Сравнение с похожими ботами

Бот Оператор Назначение Список IP
ClaudeBot Anthropic Обучение моделей ❌ Нет
Claude-SearchBot Anthropic Поисковый индекс Claude ❌ Нет
Claude-User Anthropic Пользовательские запросы в моменте ❌ Нет
GPTBot OpenAI Обучение моделей ✅ Есть
Google-Extended Google Обучение Gemini ✅ Есть (диапазоны Googlebot)
CCBot Common Crawl Открытый датасет для обучения ✅ Есть

9. Сводная таблица стратегии

Цель сайта Рекомендация
Не хочу, чтобы контент использовался для обучения Claude Disallow для ClaudeBot; Claude-User и Claude-SearchBot можно оставить открытыми
Хочу снизить нагрузку, но не блокировать полностью Crawl-delay в правиле для ClaudeBot
Хочу максимальную видимость в экосистеме Claude Allow для всех трёх агентов: ClaudeBot, Claude-User, Claude-SearchBot
В robots.txt остались правила для Claude-Web / anthropic-ai Заменить на актуальный токен ClaudeBot — старые токены задеприкейчены



Частые вопросы

Блокировка ClaudeBot уберёт сайт из ответов Claude?
Нет, полностью — нет. ClaudeBot отвечает только за обучение моделей. За появление в поиске Claude отвечает Claude-SearchBot, а за доступ по прямому запросу пользователя — Claude-User.
Anthropic публикует список IP-адресов ClaudeBot?
Нет, официально такой список не публикуется — Anthropic использует публичные IP-адреса облачных провайдеров.
Можно ли заблокировать ClaudeBot по IP вместо robots.txt?
Не рекомендуется: Anthropic прямо предупреждает, что это может помешать боту прочитать robots.txt и привести к бесконтрольному сканированию.
Что делать с правилами для Claude-Web или anthropic-ai в старом robots.txt?
Обновить их на актуальный токен ClaudeBot — оба старых токена официально задеприкейчены.
Удалится ли уже собранный контент из моделей Claude после блокировки?
Нет, блокировка действует только на будущее сканирование.
Поддерживает ли ClaudeBot директиву Crawl-delay?
Да, Anthropic официально поддерживает эту нестандартную директиву для ограничения частоты запросов.
Нужно ли отдельно настраивать правила для Claude-User и Claude-SearchBot, если я уже заблокировал ClaudeBot?
Да, все три бота Anthropic настраиваются независимо друг от друга.
Создаёт ли ClaudeBot заметную нагрузку на сервер?
По данным trafficveil краулеры категории обучения моделей, включая ClaudeBot, обычно не входят в число самых нагружающих ботов, хотя на крупных сайтах суммарный трафик от полного обхода может быть заметен.
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil