TrafficVeil
Боты 5 мин21 июля 2026 г.

ClaudeBot

ClaudeBot — основной краулер Anthropic, который собирает публично доступный веб-контент для обучения и улучшения генеративных моделей семейства Claude. Это самый узнаваемый и старый из трёх официально задокументированных ботов Anthropic, находящийся в центре большей части публичной дискуссии об AI-краулерах — в том числе из-за нашумевших данных Cloudflare о крайне высоком соотношении «сканирование / переходы по ссылкам» у AI-краулеров в целом.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое ClaudeBot
  2. 2. Как работает ClaudeBot
  3. 3. Нагрузка на сервер
  4. 4. Обнаружение в логах
  5. Поиск по User-Agent
  6. Верификация — почему IP-блокировка здесь не работает как обычно
  7. 5. robots.txt
  8. 6. Управление на уровне сервера
  9. Nginx
  10. Apache (.htaccess)
  11. 7. Рекомендации по оптимизации
  12. 8. Сравнение с похожими ботами
  13. 9. Сводная таблица стратегии
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Важно сразу разграничить: ClaudeBot отвечает только за обучение моделей. Он не участвует в построении поискового индекса Claude (это делает Claude-SearchBot) и не обрабатывает запросы, инициированные пользователем в моменте (за это отвечает Claude-User). Все три бота настраиваются в robots.txt независимо друг от друга.

1. Что такое ClaudeBot

Параметр Значение
User-Agent (токен) ClaudeBot
Полная строка UA Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
Оператор Anthropic
Назначение Сбор публичного веб-контента для обучения и улучшения моделей Claude
Официальная документация Claude Help Center — «Does Anthropic crawl data from the web...»
Список IP-адресов ❌ Официально не публикуется
Соблюдение robots.txt Да, официально подтверждено, включая нестандартную директиву Crawl-delay
Обходит CAPTCHA и антибот-защиту Нет — Anthropic официально заявляет об уважении anti-circumvention технологий
Предшественники (задеприкейчены) Claude-Web, anthropic-ai

Блокировка ClaudeBot означает, что будущий контент сайта не должен использоваться при обучении моделей Claude. Ключевое слово — «будущий»: блокировка не удаляет ранее собранный и уже использованный в обучении контент, она лишь исключает сайт из последующих циклов сбора данных.

2. Как работает ClaudeBot

  • Проактивно обходит публично доступные страницы сайта, аналогично классическим поисковым краулерам;
  • Учитывает как стандартную директиву Disallow, так и нестандартную Crawl-delay, позволяющую задать минимальный интервал между запросами;
  • Не пытается обходить CAPTCHA или другие технологии защиты от автоматического доступа;
  • Работает с публичных облачных IP-адресов провайдеров — то есть не имеет выделенного, постоянного диапазона, который можно однозначно заблокировать по IP.

3. Нагрузка на сервер

По данным мониторинга bot-трафика trafficveil (ClickHouse, 696 доменов, 161 уникальный бот, март–июнь 2026) краулеры категории «обучение моделей», включая ClaudeBot, как правило, не относятся к числу самых агрессивных по объёму запросов на конкретный сайт — заметно больший вклад в общую нагрузку исторически вносят краулеры вроде Meta ExternalAgent или Bytespider. Тем не менее сама природа обучающего краулера — полный периодический обход сайта — делает суммарный трафик значимым на крупных сайтах с большим числом страниц.

4. Обнаружение в логах

Поиск по User-Agent

# Все запросы от ClaudeBot
grep "ClaudeBot" /var/log/nginx/access.log

# Количество запросов за сегодня
grep "ClaudeBot" /var/log/nginx/access.log | grep "$(date '+%d/%b/%Y')" | wc -l

# Уникальные IP-адреса
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $1}' | sort -u

# Топ сканируемых разделов
grep "ClaudeBot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20

Верификация — почему IP-блокировка здесь не работает как обычно

В отличие от GPTBot, OAI-SearchBot или Googlebot, Anthropic официально не публикует список IP-адресов своих ботов и прямо предупреждает: её боты используют публичные IP-адреса облачных провайдеров, поэтому блокировка этих диапазонов может помешать боту прочитать сам файл robots.txt — то есть привести к обратному эффекту (бот продолжит сканирование без учёта директив, потому что не смог их получить).

# Проверка через reverse DNS — вспомогательный, не окончательный метод
# (официального списка IP от Anthropic нет, поэтому это лишь косвенный сигнал)
IP="1.2.3.4"
dig +short -x "$IP"
#!/bin/bash
# Логирование запросов ClaudeBot для собственного анализа паттерна поведения,
# так как IP-верификация против официального списка недоступна
LOG_FILE="/var/log/nginx/access.log"

echo "IP-адрес | Кол-во запросов | Reverse DNS"
echo "-------------------------------------------"

grep "ClaudeBot" "$LOG_FILE" | awk '{print $1}' | sort | uniq -c | sort -rn | while read count ip; do
    ptr=$(dig +short -x "$ip" 2>/dev/null)
    ptr=${ptr:-"нет PTR-записи"}
    echo "$ip | $count | $ptr"
done

Официальная рекомендация Anthropic при подозрении на некорректное поведение бота — писать напрямую на claudebot@anthropic.com с указанием домена, а не пытаться блокировать по IP.

5. robots.txt

# Полная блокировка обучающего краулера
User-agent: ClaudeBot
Disallow: /

# Ограничение частоты вместо полной блокировки
User-agent: ClaudeBot
Crawl-delay: 1

# Блокировка только части сайта
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /internal/
Allow: /

# Полный разрешающий доступ
User-agent: ClaudeBot
Allow: /

Правило для ClaudeBot не распространяется на Claude-User и Claude-SearchBot — для полного исключения из экосистемы Claude нужны отдельные директивы для каждого токена.

6. Управление на уровне сервера

Nginx

if ($http_user_agent ~* "ClaudeBot") {
    return 403;
}

# Мягкий вариант — ограничение частоты вместо полной блокировки
limit_req_zone $binary_remote_addr zone=claudebot:10m rate=10r/m;

location / {
    if ($http_user_agent ~* "ClaudeBot") {
        limit_req zone=claudebot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} ClaudeBot [NC]
RewriteRule ^ - [F,L]

Важно: не дублируйте эту блокировку на уровне сетевого firewall по IP-диапазонам облачных провайдеров — это может задеть множество не связанных с Anthropic сервисов, работающих на тех же общих IP.

7. Рекомендации по оптимизации

  • Решение по ClaudeBot — это решение только про обучение: блокировка не влияет на видимость в поиске Claude (Claude-SearchBot) и на доступность страниц по прямым пользовательским запросам (Claude-User);
  • Не используйте IP-блокировку как основной метод — Anthropic прямо предупреждает, что это может помешать боту прочитать сам robots.txt;
  • Используйте Crawl-delay, если цель — снизить нагрузку, а не закрыть доступ полностью — Anthropic официально поддерживает эту директиву;
  • Учитывайте необратимость обучения: блокировка не удаляет уже собранный и использованный в обучении контент, действует только на будущее сканирование;
  • При подозрении на некорректное поведение бота — пишите на claudebot@anthropic.com с указанием домена, а не полагайтесь на самостоятельную диагностику по IP.

8. Сравнение с похожими ботами

Бот Оператор Назначение Список IP
ClaudeBot Anthropic Обучение моделей ❌ Нет
Claude-SearchBot Anthropic Поисковый индекс Claude ❌ Нет
Claude-User Anthropic Пользовательские запросы в моменте ❌ Нет
GPTBot OpenAI Обучение моделей ✅ Есть
Google-Extended Google Обучение Gemini ✅ Есть (диапазоны Googlebot)
CCBot Common Crawl Открытый датасет для обучения ✅ Есть

9. Сводная таблица стратегии

Цель сайта Рекомендация
Не хочу, чтобы контент использовался для обучения Claude Disallow для ClaudeBot; Claude-User и Claude-SearchBot можно оставить открытыми
Хочу снизить нагрузку, но не блокировать полностью Crawl-delay в правиле для ClaudeBot
Хочу максимальную видимость в экосистеме Claude Allow для всех трёх агентов: ClaudeBot, Claude-User, Claude-SearchBot
В robots.txt остались правила для Claude-Web / anthropic-ai Заменить на актуальный токен ClaudeBot — старые токены задеприкейчены



Частые вопросы

Блокировка ClaudeBot уберёт сайт из ответов Claude?

Нет, полностью — нет. ClaudeBot отвечает только за обучение моделей. За появление в поиске Claude отвечает Claude-SearchBot, а за доступ по прямому запросу пользователя — Claude-User.

Anthropic публикует список IP-адресов ClaudeBot?

Нет, официально такой список не публикуется — Anthropic использует публичные IP-адреса облачных провайдеров.

Можно ли заблокировать ClaudeBot по IP вместо robots.txt?

Не рекомендуется: Anthropic прямо предупреждает, что это может помешать боту прочитать robots.txt и привести к бесконтрольному сканированию.

Что делать с правилами для Claude-Web или anthropic-ai в старом robots.txt?

Обновить их на актуальный токен ClaudeBot — оба старых токена официально задеприкейчены.

Удалится ли уже собранный контент из моделей Claude после блокировки?

Нет, блокировка действует только на будущее сканирование.

Поддерживает ли ClaudeBot директиву Crawl-delay?

Да, Anthropic официально поддерживает эту нестандартную директиву для ограничения частоты запросов.

Нужно ли отдельно настраивать правила для Claude-User и Claude-SearchBot, если я уже заблокировал ClaudeBot?

Да, все три бота Anthropic настраиваются независимо друг от друга.

Создаёт ли ClaudeBot заметную нагрузку на сервер?

По данным trafficveil краулеры категории обучения моделей, включая ClaudeBot, обычно не входят в число самых нагружающих ботов, хотя на крупных сайтах суммарный трафик от полного обхода может быть заметен.

TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Claude Search Bot

Claude-SearchBot — краулер Anthropic, отвечающий за качество и релевантность поисковых функций Claude. Он индексирует публичный веб-контент, чтобы Claude мог возвращать актуальные, точные ответы с цитированием источников, когда пользователь задаёт вопрос, требующий свежих данных из интернета. Это не обучающий краулер: собранные данные используются исключительно для поискового слоя Claude, а не для тренировки моделей.

3 мин

Claude User

Claude-User — агент Anthropic, который срабатывает не по расписанию, а по прямому действию пользователя. Когда человек в Claude просит прочитать конкретную страницу, вставляет ссылку в диалог или задаёт вопрос, требующий обращения к конкретному URL, именно Claude-User выполняет этот запрос в моменте. Это не плановый краулер, а реактивный агент, чьё появление в логах коррелирует с объёмом пользовательских запросов, а не с расписанием индексации.

5 мин

ChatGPT-User

ChatGPT-User — агент OpenAI, который срабатывает не по расписанию, а по действию пользователя. Когда человек в ChatGPT (или в кастомном GPT) задаёт вопрос, требующий обращения к конкретной странице, либо взаимодействует с внешним приложением через GPT Actions, именно ChatGPT-User выполняет этот запрос и приносит ссылку на источник в ответе.

3 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.