Боты7 мин чтения·21 августа 2026 г.

Cohere Training Data Crawler: известный training-бот enterprise AI

Cohere — не безымянный оператор, а известная компания корпоративных языковых моделей, и её краулер официально задокументирован под именем Cohere-AI. Разбираемся, почему в логах стоит искать сразу два связанных токена, чтобы не упустить часть трафика, и почему здесь, в отличие от многих других ботов, robots.txt действительно работает.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Cohere Training Data Crawler: нежелательный ai и llm-краулеры

В отличие от многих записей в этой энциклопедии, оценка риска в черновике для Cohere Training Data Crawler в целом верна — но формулировка «оператор не указан публично» здесь не соответствует действительности. Cohere — крупная, хорошо известная компания в сфере корпоративных языковых моделей (cohere.com), и её краулер официально задокументирован под собственным именем.

1. Что такое Cohere Training Data Crawler на самом деле

Cohere — один из заметных игроков рынка enterprise LLM, наравне с OpenAI и Anthropic, но ориентированный именно на бизнес-заказчиков. Официальный краулер компании собирает публичный контент для обучения языковых моделей, которые затем продаются как часть корпоративных AI-продуктов Cohere.

Официальный User-Agent:

Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/)

Важный нюанс, которого нет в черновике: в открытых источниках встречаются два разных, но, по всей видимости, связанных токена — краткий cohere-ai (используется в официальной строке UA и большинстве современных гайдов по robots.txt) и более описательный cohere-training-data-crawler, который фигурирует в независимых каталогах ботов и системах защиты вроде DataDome. Чтобы не упустить часть трафика, при настройке правил разумно перекрыть оба варианта.

Параметр Значение
Название Cohere Training Data Crawler (он же Cohere-AI)
Оператор Cohere — официально задокументированная компания-разработчик enterprise LLM, cohere.com
Роль Сбор публичного текстового контента для обучения языковых моделей Cohere
User-Agent / паттерн Cohere-AI/1.0 (официальный) и cohere-training-data-crawler (встречается в независимых каталогах и антибот-системах) — при настройке правил стоит перекрыть оба
robots.txt По независимым данным, Cohere в целом относится к операторам, уважающим robots.txt — в отличие от многих других записей энциклопедии, здесь файл действительно имеет практический смысл
Влияние на классический SEO Блокировка не затрагивает индексацию в Google/Yandex — это подтверждают независимые источники, а не только предположение
Пометка TrafficVeil Нежелательный / AI и LLM-краулеры

2. Зачем Cohere Training Data Crawler приходит на сайт

  • сбор публичного текста для обучающих корпусов, которые используются при тренировке и дообучении языковых моделей Cohere;
  • охват обычно широкий и не привязан к конкретному запросу пользователя — это классический training-краулер, а не user-triggered fetcher вроде ChatGPT-User;
  • как и у большинства AI data scraper-ов, паттерн выбора сайтов и частоты обхода компанией публично не раскрывается.

Типичный кейс из черновика — системный обход /blog/, /product/, /category/, /news/ и пагинации каталога по ночам без конверсий — полностью соответствует ожидаемому поведению training-краулера такого типа.

3. Нагрузка и риски

Здесь черновик в целом прав: главный риск — не нагрузка на сервер, а то, что уникальные тексты, описания товаров и статьи уходят в обучающий корпус коммерческой AI-компании без кликов, атрибуции и какой-либо компенсации. Это стандартный риск-профиль для training-краулеров (в отличие, например, от search/retrieval-краулеров вроде тех же ChatGPT-User или PerplexityBot, которые могут приводить реферальный трафик).

Стоит отдельно учитывать вторичный эффект: если контент сайта в итоге используется для обучения моделей, которые впоследствии питают AI-поиск, блокировка может слегка снижать долгосрочную «видимость» в AI-генерируемых ответах — но это не аргумент против блокировки самой по себе, а лишь фактор для взвешенного решения.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти Cohere Training Data Crawler в логах

# Базовый поиск — оба варианта токена
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов Cohere в открытых источниках не найдено — для решения allow/deny смотрите связку UA + IP/ASN + системный, широкий паттерн обхода, типичный именно для training-краулера:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Cohere Training Data Crawler

# Жёсткий запрет по обоим известным вариантам токена
User-agent: cohere-ai
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /

# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в обучающих корпусах
User-agent: cohere-ai
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cohere-ai
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=cohereai:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
        limit_req zone=cohereai burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cohere-training-data-crawler [NC,OR]
RewriteCond %{HTTP_USER_AGENT} cohere-ai [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите оба варианта токена в разделе ботов домена или в /system/bots;
  • для подавляющего большинства сайтов — Disallow/запрет обоснованы сразу, поскольку прямой пользы от training-краулера почти никогда нет;
  • поскольку Cohere в целом относится к операторам, уважающим robots.txt, файл здесь — не просто формальность, как для многих других записей энциклопедии;
  • после изменения сверьте логи: хиты по обоим токенам должны уйти в блок/лимит, а Google/Yandex остаться без изменений.

7. Что делать: короткий алгоритм

  • Пользы нет — Disallow/403 по обоим известным токенам, это рекомендуемый вариант по умолчанию;
  • Хотите разрешить AI-поиск, но не training — по аналогии с другими AI-компаниями стоит уточнить, публикует ли Cohere отдельный UA для retrieval-сценариев (на момент написания статьи такой отдельный токен не задокументирован независимо от training-краулера);
  • Нагрузка заметна — rate-limit как промежуточный шаг, хотя для большинства сайтов достаточно сразу Disallow;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать Cohere Training Data Crawler

Бот / сосед Кластер Комментарий
AnthropicBot (anthropic-ai) AI и LLM-краулеры Официальный training-краулер Anthropic — тот же тип риска, другой оператор
AI2Bot / AI2Bot-Dolma AI и LLM-краулеры Некоммерческие training-краулеры Allen Institute for AI
ChatGPT-User AI и LLM-краулеры Принципиально другой тип — user-triggered fetcher, а не training-краулер; иная логика риска
AzureAI-SearchBot AI и LLM-краулеры Retrieval/search-краулер Microsoft, а не training — тоже стоит различать по типу, а не только по названию оператора

9. Стратегия allow/deny для Cohere Training Data Crawler

Ситуация Действие
Обычный сайт, пользы от обучения чужой LLM нет Disallow по обоим токенам + запрет в TrafficVeil
Сайт сознательно хочет присутствовать в обучающих корпусах Cohere Allow — редкий, но возможный осознанный сценарий
Нагрузка заметна Rate-limit как промежуточная мера
Хотите отличать training от search/retrieval трафика Cohere На данный момент отдельного официального retrieval-токена не задокументировано — относиться ко всему трафику как к training
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и системный, широкий паттерн обхода

Частые вопросы

Cohere Training Data Crawler — это анонимный сборщик данных?
Нет, оператор — Cohere, известная компания в сфере enterprise-языковых моделей, с официально задокументированным краулером.
Почему стоит искать сразу два токена в логах?
Потому что встречаются и официальный cohere-ai, и более описательный cohere-training-data-crawler — оба, по всей видимости, относятся к одному и тому же краулеру.
Работает ли robots.txt против этого краулера?
Да, по независимым данным Cohere в целом уважает правила robots.txt — здесь файл имеет реальный практический смысл.
Повлияет ли блокировка на позиции сайта в Google или Яндексе?
Нет, это подтверждено независимо — блокировка training-краулеров AI-компаний не затрагивает классическую поисковую индексацию.
Чем этот бот отличается от ChatGPT-User или AzureAI-SearchBot?
Это training-краулер, собирающий данные для обучения моделей впрок, а не user-triggered fetcher, работающий по запросу конкретного пользователя в реальном времени.
Стоит ли вообще блокировать Cohere Training Data Crawler?
Для большинства сайтов да — прямой пользы от обучения чужой коммерческой модели практически никогда нет.
#Cohere#Cohere-AI#AI и LLM-краулеры#training data#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil