TrafficVeil
Боты 6 мин23 августа 2026 г.

ContentAtScale: SERP-анализ под статью, а не AI-краулер

ContentAtScale принадлежит известной платформе генерации SEO-контента (ныне BrandWell AI), которая проводит реал-тайм SERP-анализ под каждую генерируемую статью, а не собирает контент впрок для обучения AI-модели. Разбираемся, почему обращение к вашей странице почти всегда означает, что кто-то из клиентов платформы сейчас пишет статью на ту же тему, и почему реальный риск — конкурентная разведка, а не утечка в чат-бота.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое ContentAtScale на самом деле
  2. 2. Зачем ContentAtScale приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти ContentAtScale в логах
  5. 5. robots.txt для ContentAtScale
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для ContentAtScale
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

ContentAtScale — снова случай неверной категоризации по тому же образцу, что уже разбирался с Content Harmony и Content King. Реальный оператор — Content at Scale (ныне переименован в BrandWell AI, contentatscale.ai) — известная AI-платформа для написания SEO-контента, основанная Джастином Макгиллом. Обращение к сайту, скорее всего, означает не наполнение обучающего AI-индекса, а конкурентный SERP-анализ для конкретной статьи, которую в этот момент генерирует клиент платформы.

1. Что такое ContentAtScale на самом деле

Content at Scale (BrandWell AI) — платформа для генерации длинных SEO-статей, основанная в 2020-х годах Джастином Макгиллом. По независимым обзорам сервиса, платформа проводит SERP-анализ в реальном времени и строит собственную базу данных под каждую конкретную статью, обходя топ-ранжирующийся контент, новости и соцсети по исследуемому ключевому запросу — а затем использует эти данные вместе с несколькими языковыми моделями, чтобы сгенерировать статью в человекоподобном стиле.

Это принципиально другая модель поведения, чем у training-краулеров вроде GPTBot: обход привязан к конкретному запросу конкретного клиента платформы (какая статья сейчас генерируется и по какому ключевому слову), а не к системному фоновому сбору контента впрок для обучения базовой модели. По логике это ближе к уже разобранным в этой энциклопедии Content Harmony и Cincraw — инструментам конкурентного контент-анализа для SEO, чем к AI и LLM-краулерам training-типа.

Параметр Значение
Название ContentAtScale
Оператор Content at Scale, ныне BrandWell AI (contentatscale.ai) — AI-платформа для SEO-контента, CEO Джастин Макгилл
Вероятная роль Реал-тайм SERP-анализ конкретного ключевого запроса, по которому клиент платформы в данный момент генерирует статью — конкурентный контент-анализ, а не системный training-обход
User-Agent / паттерн contentatscale
Официальная документация краулера Не найдена — вывод о поведении сделан по независимым описаниям функциональности продукта (SERP-анализ и построение базы под каждую статью)
robots.txt Нет публичных данных о соблюдении
Более точная категория SEO-инструменты конкурентного контент-анализа (в одном ряду с Content Harmony, Clearscope, Cincraw) — не AI и LLM-краулер (см. раздел 8)
Пометка TrafficVeil Легитимный / AI и LLM-краулеры — категория, вероятно, требует пересмотра

2. Зачем ContentAtScale приходит на сайт

  • ваша страница попала в топ выдачи по ключевому запросу, который в данный момент исследует клиент платформы, генерируя собственную статью на ту же тему — обход привязан к этому конкретному запросу, а не к вашему сайту как таковому;
  • анализ структуры, тем и содержания ранжирующегося контента нужен, чтобы сгенерированная статья была конкурентоспособна в текущей выдаче;
  • в отличие от системных training-краулеров, здесь нет цели «собрать контент впрок» — обход определяется тем, какие запросы исследуют клиенты платформы прямо сейчас.

Типичный кейс: страница внезапно попадает в фокус ContentAtScale вскоре после того, как поднялась в выдаче по конкурентному запросу — это признак того, что кто-то из клиентов платформы генерирует статью на ту же тему и использует вашу страницу как часть SERP-анализа, а не системно собирает контент со всего сайта.

3. Нагрузка и риски

Ключевая поправка к черновику: формулировка «рискуете отдать уникальные тексты... в чужой AI-контур без кликов и атрибуции» здесь описывает риск training-краулеров вроде GPTBot не вполне точно — данные, судя по всему, используются для разового конкурентного анализа под конкретную генерируемую статью конкретного клиента, а не для пополнения базовой обучающей выборки модели. Более точный риск — конкурентная контентная разведка: кто-то анализирует структуру и содержание вашей ранжирующейся страницы, чтобы сгенерировать конкурирующий материал.

Нагрузка для большинства сайтов минимальна — обращения точечные, привязаны к конкретным ранжирующимся URL по исследуемым в данный момент запросам, а не к системному обходу всего каталога или блога.

4. Как найти ContentAtScale в логах

# Базовый поиск
grep -i "contentatscale" /var/log/nginx/access.log

# Топ URL — ожидаемо это будут именно высокоранжирующиеся страницы
grep -i "contentatscale" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "contentatscale" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "contentatscale" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов не найдено — для решения allow/deny смотрите связку UA + IP/ASN + характер запрошенных URL (высокоранжирующиеся страницы по конкретным запросам, а не системный обход всего сайта):

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для ContentAtScale

# Жёсткий запрет
User-agent: contentatscale
Disallow: /

# Разрешить всё
User-agent: contentatscale
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: contentatscale
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "contentatscale") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=contentatscale:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "contentatscale") {
        limit_req zone=contentatscale burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} contentatscale [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите contentatscale в разделе ботов домена или в /system/bots;
  • для большинства сайтов прямой пользы от allow нет, но и риск для контента ограничен разовым конкурентным анализом под конкретный запрос, а не системным сбором для AI-обучения — блокировка скорее вопрос принципа, чем защиты от массированной угрозы;
  • после изменения сверьте логи: хиты ContentAtScale должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Прямой пользы для сайта нет, конкурентная разведка нежелательна — Disallow/403;
  • Не применяйте к этому боту логику «риск утечки в AI-контур для обучения модели» — реальный механизм ближе к разовому SERP-анализу под конкретную статью;
  • Нагрузка минимальна, обращения точечные — можно не трогать;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит пересмотреть категорию: ContentAtScale ошибочно отнесён к «AI и LLM-краулеры» с формулировкой про наполнение обучающего AI-индекса — по факту это, судя по независимым описаниям продукта, инструмент реал-тайм SERP-анализа для генерации SEO-статей под конкретный запрос, той же природы, что уже разобранные в этой энциклопедии Content Harmony и Cincraw. Логичнее разместить его рядом с ними или в отдельной под-категории «Инструменты контент-брифов / AI-копирайтинга», а не смешивать с GPTBot и подобными training-краулерами.

Бот / сосед Категория Комментарий
Content Harmony Требует пересмотра (см. отдельную статью) Та же ошибка категоризации — SEO-инструмент контент-брифов, ошибочно попавший в AI-краулеры
Cincraw Требует пересмотра (см. отдельную статью) Похожая природа — SEO-аналитика конкурентного контента с продуманной политикой обхода
ContentBot Требует уточнения (см. отдельную статью) Похожий паттерн user-triggered fetcher-а вместо системного training-краулера
GPTBot AI и LLM-краулеры Настоящий training-краулер с системным фоновым обходом — принципиально иная природа, чем у ContentAtScale

9. Стратегия allow/deny для ContentAtScale

Ситуация Действие
Прямой пользы нет, конкурентная разведка нежелательна Disallow + запрет в TrafficVeil
Нагрузка минимальна, обращения точечные Можно не трогать
Ошибочно применена логика «AI-краулер, риск утечки в обучение модели» Пересмотреть — реальный риск другой (конкурентный SERP-анализ, не AI-training)
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и то, что запрашиваются именно высокоранжирующиеся страницы по конкретным запросам

Частые вопросы

ContentAtScale собирает контент моего сайта для обучения AI-модели?

Нет, это неверная категоризация — платформа проводит SERP-анализ под конкретную генерируемую статью, а не системный сбор для обучения модели.

Почему именно моя страница попала в поле зрения ContentAtScale?

Вероятнее всего, она ранжируется в топе выдачи по запросу, который сейчас исследует клиент платформы, генерируя статью на ту же тему.

В чём реальный риск, если не в AI-обучении?

Конкурентная разведка — кто-то анализирует структуру и содержание вашей ранжирующейся страницы для конкурирующей AI-генерируемой статьи.

Чем ContentAtScale похож на Content Harmony или Cincraw?

Той же логикой разового конкурентного контент-анализа для SEO, а не системным training-краулингом.

Стоит ли пересмотреть категорию ContentAtScale в базе TrafficVeil?

Да, похоже, запись ошибочно попала в «AI и LLM-краулеры» вместо категории SEO-инструментов конкурентного анализа.

Создаёт ли этот бот заметную нагрузку на сервер?

Обычно нет — обращения точечные и привязаны к конкретным ранжирующимся URL, а не к системному обходу всего сайта.

#ContentAtScale#BrandWell AI#AI-краулеры#SEO-контент#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.