TrafficVeil
Боты 5 мин25 августа 2026 г.

TerraCotta в логах: AI-краулер, а не сервис интеграции

TerraCotta — не техническая служба верификации аккаунта, а краулер, который по данным открытых каталогов ботов собирает контент для обучения LLM или AI-поиска. Разбираем реальное назначение бота, как найти его в логах и настроить allow, rate-limit или блокировку через TrafficVeil.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Зачем TerraCotta приходит на сайт
  2. Что такое TerraCotta
  3. Как найти TerraCotta в логах
  4. Нагрузка и риски именно для TerraCotta
  5. robots.txt для TerraCotta
  6. Блокировка вручную и через TrafficVeil
  7. Nginx
  8. Apache (.htaccess)
  9. TrafficVeil
  10. С кем не путать TerraCotta
  11. Стратегия allow/deny для TerraCotta
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

TerraCotta — не тот случай, когда за именем бота скрывается что-то безобидно-техническое вроде верификации аккаунта. По данным сразу нескольких независимых открытых каталогов ботов, включая известный community-реестр ai.robots.txt, это краулер, который собирает контент с сайтов для нужд AI и LLM — обучающих корпусов или поискового индекса генеративного сервиса. В каталоге TrafficVeil он тем не менее помечен как легитимный в категории «Прочие краулеры и сервисы» — решение allow/deny стоит принимать осознанно, понимая, что именно вы разрешаете.

Зачем TerraCotta приходит на сайт

Разные открытые каталоги ботов связывают TerraCotta с компанией Ceramic и описывают его задачу как сбор общедоступного веб-контента — либо для обучения больших языковых моделей, либо для построения поискового индекса, который питает AI-поисковый продукт этой компании. Формулировки у источников расходятся в деталях (обучение модели или поисковая индексация), но сходятся в главном: TerraCotta вычитывает содержимое страниц целиком, а не проверяет доступность или метаданные аккаунта.

Практическое следствие для владельца сайта: если контент попадает в обучающую выборку или в AI-поисковый индекс, это может увеличивать присутствие бренда в ответах генеративных сервисов — но одновременно означает, что материалы страниц используются за пределами обычной поисковой выдачи. Типичный сигнал для диагностики: CDN-трафик дорожает, origin CPU нагружен вычиткой HTML, а в фильтре по terracotta видно систематический проход по разделам сайта, а не единичные точечные запросы.

Что такое TerraCotta

Параметр Значение
Название TerraCotta
User-Agent / паттерн terracotta (в некоторых источниках также встречается написание "Terra Cotta")
Оператор По данным открытых каталогов ботов — связан с компанией Ceramic; официального подтверждения от самого оператора на сайте не обнаружено
Роль Сбор общедоступного веб-контента для AI/LLM-задач — обучающие данные или AI-поисковый индекс
Документация / ориентир Токен присутствует в открытом community-реестре AI-краулеров (ai.robots.txt); отдельной официальной страницы оператора не найдено
Список IP ❌ Публичного подтверждённого списка IP нет; проверяйте ASN и не доверяйте только строке UA
robots.txt Данные каталогов расходятся: часть источников сообщает о соблюдении Robots Exclusion Protocol, другие — что бот не гарантированно следует директивам; полагаться стоит на поведенческую проверку, а не только на файл
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

Как найти TerraCotta в логах

Ищите конкретный токен terracotta, а не общее слово «bot» — рядом сразу смотрите, ведёт ли он себя как систематический обход или как единичные точечные запросы.

# Базовый поиск
grep -i "terracotta" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "terracotta" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "terracotta" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "terracotta" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация здесь особенно важна: подделать User-Agent может любой скрипт, а официального перечня IP от оператора нет, поэтому смотрите связку UA + ASN/IP + частота + глубина обхода. Например, если запросы идут с нескольких IP параллельно и покрывают заметную долю каталога за короткое время — это больше похоже на системный сбор контента, чем на случайный шум.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

Нагрузка и риски именно для TerraCotta

Отдельной строки в публичной сводке топ-ботов TrafficVeil у terracotta может не быть, но по функции это полноценный контентный краулер, а не лёгкий health-check — значит, и нагрузка от него потенциально выше, чем от типичного «прочего сервиса». Смотрите не только на абсолютный RPS, но и на:

  • глубину обхода — систематический проход по разделам, а не 2-3 фиксированных URL;
  • повторы одних и тех же адресов без видимой причины;
  • отсутствие cookie и признаков сессии;
  • серии запросов, которые на отдельных доменах выглядят как мини-волны автоматизации без единой конверсии в аналитике.

robots.txt для TerraCotta

# Жёсткий запрет
User-agent: terracotta
Disallow: /

# Разрешить всё
User-agent: terracotta
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичную часть
User-agent: terracotta
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Поскольку источники расходятся в оценке соблюдения robots.txt этим ботом, файл стоит рассматривать как первый, но не единственный рубеж контроля. Если после настройки Disallow хиты terracotta продолжаются в логах — это повод сразу переходить к блокировке на уровне nginx/Apache или через TrafficVeil, а не ждать и перепроверять файл повторно.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "terracotta") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=terracotta:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "terracotta") {
        limit_req zone=terracotta burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} terracotta [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • найдите terracotta / TerraCotta в ботах домена или в /system/bots;
  • если участие в AI-обучении или AI-поиске нежелательно для бизнеса — категория «запретить»; если нагрузка терпима, но частота избыточна — rate-limit;
  • allow оставляйте осознанно — например, если присутствие в AI-ответах и поисковых системах нового поколения важно для видимости бренда;
  • после изменения сверьте логи: хиты TerraCotta должны уйти в блок/лимит, а нужные поисковики остаться нетронутыми.

С кем не путать TerraCotta

Бот / сосед Кластер UA Комментарий
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный
Agent Прочие краулеры и сервисы agent легитимный
AgentReadinessScanner Прочие краулеры и сервисы agentreadinessscanner легитимный

Стратегия allow/deny для TerraCotta

Ситуация Действие
Присутствие в AI-обучении/AI-поиске важно для видимости бренда Allow + закрыть /admin /cart /api
Использование контента для AI нежелательно Disallow + запрет в TrafficVeil
Обход в целом приемлем, но нагрузка избыточна Rate-limit на nginx/TrafficVeil
Не удалось подтвердить назначение трафика Deny по умолчанию, исключения — точечно после дополнительной проверки
Подозрение на спуфинг UA Не доверять строке UA; смотреть IP/ASN, параллельность запросов и глубину обхода

Главный вывод по TerraCotta: несмотря на пометку «легитимный» в категории прочих сервисов, по факту это полноценный AI-краулер, и решение здесь стоит принимать не как для нейтрального технического клиента, а как для любого другого агента, забирающего контент сайта для генеративных AI-продуктов, — сознательно взвешивая пользу от видимости в AI-ответах против расхода ресурсов origin.

Частые вопросы

Действительно ли TerraCotta связан с интеграцией или верификацией клиентского аккаунта?

Нет — по данным нескольких независимых открытых каталогов ботов, это краулер, который собирает контент сайта для задач AI и LLM, а не сервисный клиент аккаунта.

Как в логах отличить систематический сбор контента TerraCotta от единичных технических запросов?

По глубине обхода — если бот покрывает заметную часть каталога за короткое время, а не 2-3 фиксированных URL, это указывает на полноценный контентный краулер.

Можно ли полностью полагаться на robots.txt для контроля TerraCotta?

Нет — источники расходятся в оценке того, насколько строго бот соблюдает директивы, поэтому файл стоит дополнять серверной блокировкой при первых признаках игнорирования.

Что означает разрешение доступа TerraCotta для присутствия сайта в AI-сервисах?

Контент страниц может использоваться для обучающих корпусов или AI-поискового индекса, что потенциально увеличивает видимость бренда в генеративных ответах.

Почему у TerraCotta нет официального списка IP-адресов, как у некоторых других ботов?

Публичного подтверждённого перечня от самого оператора не найдено, поэтому верификацию приходится строить на связке UA, ASN и поведения.

Стоит ли ожидать от TerraCotta такой же лёгкой нагрузки, как от ботов мониторинга?

Нет — как полноценный контентный краулер он потенциально создаёт заметно большую нагрузку на origin, чем лёгкие health-check-проверки.

#TerraCotta#Ceramic#AI-краулеры#боты на сайте#robots.txt#защита от контента#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Podimo: европейский бот, которому нужен подкаст-фид

Podimo — реальный сервис подписки на подкасты, чей бот узко специализирован на чтении RSS-фидов, а не сайтов в целом. Разбираем, почему визит нетипичен без подкаст-контента, как найти бота в логах и настроить allow, rate-limit или блокировку.

5 мин

panscient.com: вежливый бот с коммерческой целью

panscient.com — реальная компания бизнес-разведки, которая собирает и перепродаёт корпоративные данные с сайтов, но при этом технически аккуратно соблюдает robots.txt и лимит запросов. Разбираем, почему проблема здесь не в нагрузке, а в согласии на использование данных, и как настроить блокировку через robots.txt и TrafficVeil.

6 мин

TweetmemeBot: бот, переживший свой первоначальный сервис

TweetmemeBot начинал в 2009 году как краулер сервиса TweetMeme, но сегодня по данным современных каталогов ботов ассоциируется с Meltwater — платформой медиа-мониторинга для бизнеса. Разбираем историю смены владельцев, отсутствие механизма верификации и настройку allow, rate-limit или блокировки через TrafficVeil.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

TerraCotta: что за AI-краулер и как его контролировать