ClearScope — не безымянный «AI и LLM-краулер», а известная на корпоративном рынке платформа контент-оптимизации, среди клиентов которой прямо называют IBM. Это узкоспециализированный B2B-инструмент для SEO- и контент-команд, а не система общего назначения, собирающая сырьё для обучения языковой модели.
Что делает платформа и зачем ей понадобился обход сторонних сайтов
Основной продукт ClearScope построен вокруг системы «оценки» контента: сервис анализирует топ-выдачу поисковых систем по заданному ключевому слову, выявляет термины и подтемы, которые фактически используют уже хорошо ранжирующиеся страницы конкурентов, и на основе этого даёт авторам рекомендации в реальном времени — прямо внутри Google Docs, WordPress или Microsoft Word — какие термины и подтемы стоит включить в свой текст, чтобы полнее раскрыть тему. Чтобы построить такую «карту» конкурентного контента по каждому ключевому слову, платформе необходимо на лету анализировать содержимое страниц, реально занимающих высокие позиции в выдаче, — отсюда и обход сторонних сайтов.
Отдельная, более новая функция — Expand — расширяет эту логику на AI-поиск: сервис отслеживает цитирования бренда в ChatGPT и Gemini, отслеживая от 20 до 50 тем в зависимости от тарифа, и анализирует, по каким запросам AI-системы вообще ссылаются на источники. Это добавляет ещё одну правдоподобную причину обхода — не только классический анализ поисковой выдачи, но и мониторинг того, что происходит в ответах AI-ассистентов.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | clearscope |
| Оператор | Clearscope (clearscope.io) — платформа контент-оптимизации для корпоративных SEO-команд |
| Назначение | Анализ топ-выдачи по ключевым словам для рекомендаций по терминам и подтемам; отдельно — мониторинг цитирований бренда в ChatGPT и Gemini через функцию Expand |
| Целевая аудитория | Корпоративные контент- и SEO-команды; среди публично называемых клиентов — IBM |
| Тарифы и масштаб | От $129/мес (Essentials, 100 страниц контент-инвентаря) до индивидуальных условий Enterprise с возможностью «crawler whitelisting» — то есть у крупных клиентов краулер платформы официально может согласовываться с их сетевыми политиками напрямую |
| Официальная документация краулера | ❌ Отдельной публичной страницы про политику именно веб-краулера не найдено, несмотря на солидность и известность самого продукта |
| Список IP-адресов | ❌ Отсутствует в открытом доступе |
Почему шаблонная классификация вводит в заблуждение
Формулировка «сырьё для AI-пайплайна оператора» рисует картину массового, безадресного сбора текста ради обучения генеративной модели общего назначения. Реальная бизнес-модель ClearScope другая: платформа продаёт доступ к анализу конкурентной выдачи по конкретным ключевым словам конкретным клиентам, а не строит собственную LLM. Обход сторонних сайтов здесь — исследовательская функция внутри оплачиваемого B2B-продукта: платформа анализирует, что уже хорошо работает у конкурентов её клиентов по конкретной теме, а не забирает контент для перепродажи или обучения чужой модели.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "clearscope" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "clearscope" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку официального списка IP нет, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois — как и с большинством ботов без опубликованного фида.
Стоит ли блокировать
- если сайт хорошо ранжируется по коммерчески важным темам, он с высокой вероятностью периодически анализируется подобными платформами как часть исследования конкурентного контента для чужих клиентов — прямой выгоды владельцу сайта это не приносит, но и не является признаком недобросовестного скрапинга: используется только структурная и тематическая информация о том, какие термины встречаются на уже высокоранжирующихся страницах;
- если сайт сам является клиентом ClearScope, стоит уточнить у платформы возможность внесения инфраструктуры в allowlist — на Enterprise-тарифе такая опция официально предусмотрена;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет напрямую — сам факт анализа выдачи не меняет ранжирование анализируемых страниц.
Как заблокировать или разрешить
Стандартный запрет через robots.txt:
User-agent: clearscope
Disallow: /
Явное разрешение, если сайт заинтересован в присутствии в подобном анализе (например, для отраслевого контента, который логично сравнивать с конкурентами):
User-agent: clearscope
Allow: /
Поскольку официального подтверждения соблюдения robots.txt для этого агента не найдено, для надёжности блокировку стоит продублировать на уровне сервера:
if ($http_user_agent ~* "clearscope") {
return 403;
}Частые вопросы
ClearScope собирает данные для обучения AI-моделей общего назначения?
Зачем боту анализировать сторонние сайты?
Что за новая функция Expand у платформы?
Есть ли у клиентов ClearScope возможность согласовать доступ краулера напрямую?
Стоит ли блокировать бота, если сайт хорошо ранжируется по коммерческим темам?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.