ContentBot принадлежит не безымянному AI-пайплайну, а реальной, работающей с 2021 года компании ContentBot.ai (Майами, США) — платформе AI-генерации контента для маркетологов и блогеров, в одном ряду с Anyword и Copy.ai. Черновик утверждает, что «почти наверняка ваш контент интересен как сырьё для AI-продукта» в духе GPTBot — но по функциям самой платформы более вероятен другой, гораздо менее тревожный сценарий.
1. Что такое ContentBot на самом деле
ContentBot.ai — AI-платформа для генерации блог-постов, лендингов и рекламных текстов, с более чем 77 000 зарегистрированных пользователей, интеграциями с WordPress, Chrome, Google Docs и другими сервисами. Среди функций платформы — «AI Importer» и инструменты массового импорта CSV/PDF, которые позволяют пользователям загружать существующий контент (свой или чужой) в качестве референса или сырья для дальнейшей AI-обработки внутри сервиса.
Это принципиально другая модель, чем у training-краулеров вроде GPTBot: там бот системно обходит веб по расписанию для пополнения обучающих датасетов модели. Здесь, судя по функциям продукта, более вероятен user-triggered fetcher — запрос к конкретному URL, который инициировал конкретный пользователь платформы, импортируя чужую или свою страницу как референс для генерации контента.
| Параметр | Значение |
| Название | ContentBot |
| Оператор | ContentBot.ai — AI-платформа генерации контента, Майами, основана в 2021 году |
| Вероятная роль | User-triggered fetcher, привязанный к функции импорта контента/URL конкретным пользователем платформы — а не системный training-краулер |
| User-Agent / паттерн | contentbot |
| Официальная документация краулера | Не найдена — вывод о поведении сделан по функциям продукта, а не по прямому заявлению оператора |
| robots.txt | Нет публичных данных о соблюдении |
| Пометка TrafficVeil | Легитимный / AI и LLM-краулеры — категория условно верна по типу компании, но логика риска ближе к user-triggered fetcher, чем к training-краулеру (см. раздел 8) |
2. Зачем ContentBot приходит на сайт
- пользователь платформы использует функцию AI Importer или массового импорта, указав ваш URL как источник для анализа/референса перед генерацией собственного контента;
- это может быть как ваш же собственный сайт (если вы сами пользуетесь ContentBot для своего контент-маркетинга), так и сайт конкурента, который кто-то использует как ориентир;
- в отличие от training-краулеров, которые системно проходят /blog/, /product/, /category/ по расписанию, такие запросы, вероятнее всего, единичны и привязаны к конкретному моменту работы конкретного пользователя.
Если в логах фиксируется постоянный систематический обход широкого набора страниц сайта, а не единичные точечные запросы к конкретным URL — это может говорить и о другом сценарии, не описанном в открытых источниках платформы; в таком случае стоит опираться на наблюдаемое поведение, а не на предположение о разовом fetcher-запросе.
3. Нагрузка и риски
Если верна гипотеза о user-triggered fetcher, нагрузка от ContentBot должна быть эпизодической и точечной — по одному-два запроса на конкретный URL, а не системный краулинг каталога. Формулировка черновика про «ваш контент интересен как сырьё для AI-продукта» ближе по духу к bulk-краулерам вроде GPTBot, которые системно индексируют контент для обучения модели — для user-triggered fetcher это не совсем точное описание риска.
Тем не менее, поскольку официальной документации по самому крауleру нет, нельзя полностью исключить и более широкий сбор данных — платформа явно занимается AI-генерацией контента, для качества которой в принципе полезны большие объёмы примеров текста.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти ContentBot в логах
# Базовый поиск
grep -i "contentbot" /var/log/nginx/access.log
# Топ URL — если гипотеза о fetcher верна, ожидаем немного точечных URL, а не широкий обход
grep -i "contentbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "contentbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность — эпизодические точечные хиты vs регулярный фон
grep -i "contentbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка гипотезы: сколько уникальных URL всего запрошено этим UA
grep -i "contentbot" /var/log/nginx/access.log | awk '{print $7}' | sort -u | wc -l
Верификация. Строку UA подделать может любой скрипт. Для решения allow/deny смотрите связку UA + IP/ASN + частоту + набор URL — при отсутствии официальных диапазонов для ContentBot это единственный доступный способ:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для ContentBot
# Жёсткий запрет
User-agent: contentbot
Disallow: /
# Разрешить всё
User-agent: contentbot
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: contentbot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "contentbot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=contentbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "contentbot") {
limit_req zone=contentbot burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} contentbot [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите contentbot в разделе ботов домена или в /system/bots;
- если наблюдаемый паттерн — единичные запросы к конкретным URL, а не системный обход — это, вероятно, безобидный разовый fetcher по чужому пользовательскому запросу, и жёсткая блокировка не даст заметного эффекта на общую нагрузку;
- если наблюдается систематический обход каталога/блога — это не соответствует ожидаемому паттерну user-triggered fetcher, здесь уместнее относиться к боту как к обычному AI-краулеру;
- после изменения сверьте логи: хиты ContentBot должны уйти в блок/лимит, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Сначала посмотрите на паттерн: единичные точечные URL или широкий систематический обход — от этого зависит вся дальнейшая логика;
- Паттерн точечный, нагрузка минимальна — можно не трогать, реального риска для контента как при training-краулерах здесь меньше;
- Паттерн широкий и системный — относитесь как к обычному AI-краулеру: Disallow, если польза не нужна;
- Нагрузка мешает независимо от паттерна — rate-limit как промежуточный шаг;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Категория «AI и LLM-краулеры» формально не ошибочна — ContentBot действительно AI-компания. Но, как и в случае с Anyword, стоит различать training-краулеры (GPTBot, ClaudeBot, CCBot — системный фоновый обход для обучения моделей) и user-triggered fetcher-ы, к которым, судя по функции AI Importer, ближе ContentBot — точечные запросы по прямому указанию конечного пользователя платформы. Возможно, для таких ботов стоит завести отдельную под-категорию с иной логикой оценки риска.
| Бот / сосед | Кластер | UA | Комментарий |
| Anyword | AI и LLM-краулеры (см. отдельную статью) | anyword | Тот же паттерн — реальная AI-копирайтинг компания, вероятно user-triggered fetcher, а не training-краулер |
| GPTBot | AI и LLM-краулеры | gptbot | Настоящий training-краулер с системным фоновым обходом — отличается от вероятной модели поведения ContentBot |
| ChatGPT-User | AI и LLM-краулеры | chatgpt-user | Официально задокументированный user-triggered fetcher — ближайший по логике аналог предполагаемого поведения ContentBot |
| AI Article Writer | AI и LLM-краулеры (черновая запись) | ai article writer | Расплывчатое название без подтверждённого оператора — стоит проверить так же, как ранее проверялся SEO Robot |
9. Стратегия allow/deny для ContentBot
| Ситуация | Действие |
| Паттерн точечный, единичные URL, минимальная нагрузка | Не трогать — похоже на безобидный разовый fetcher по запросу стороннего пользователя платформы |
| Паттерн широкий, систематический обход каталога/блога | Disallow + запрет в TrafficVeil, если польза не нужна — вести себя как с обычным AI-краулером |
| Нужен доступ, но пики нерегулярны | Rate-limit на nginx/TrafficVeil |
| Сами пользуетесь ContentBot для контент-маркетинга | Allow — это может быть ваш же собственный трафик |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и то, насколько узкий или широкий набор URL запрашивается |
Частые вопросы
ContentBot собирает контент моего сайта для обучения AI-модели?
Чем это отличается от GPTBot и других training-краулеров?
Как на практике отличить один паттерн от другого?
Может ли это быть моим же собственным трафиком?
Есть ли официальная документация по этому краулеру от самой ContentBot.ai?
Соблюдает ли ContentBot правила robots.txt?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.