В отличие от многих записей в этой энциклопедии, оценка риска в черновике для Cohere Training Data Crawler в целом верна — но формулировка «оператор не указан публично» здесь не соответствует действительности. Cohere — крупная, хорошо известная компания в сфере корпоративных языковых моделей (cohere.com), и её краулер официально задокументирован под собственным именем.
1. Что такое Cohere Training Data Crawler на самом деле
Cohere — один из заметных игроков рынка enterprise LLM, наравне с OpenAI и Anthropic, но ориентированный именно на бизнес-заказчиков. Официальный краулер компании собирает публичный контент для обучения языковых моделей, которые затем продаются как часть корпоративных AI-продуктов Cohere.
Официальный User-Agent:
Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/)
Важный нюанс, которого нет в черновике: в открытых источниках встречаются два разных, но, по всей видимости, связанных токена — краткий cohere-ai (используется в официальной строке UA и большинстве современных гайдов по robots.txt) и более описательный cohere-training-data-crawler, который фигурирует в независимых каталогах ботов и системах защиты вроде DataDome. Чтобы не упустить часть трафика, при настройке правил разумно перекрыть оба варианта.
| Параметр | Значение |
| Название | Cohere Training Data Crawler (он же Cohere-AI) |
| Оператор | Cohere — официально задокументированная компания-разработчик enterprise LLM, cohere.com |
| Роль | Сбор публичного текстового контента для обучения языковых моделей Cohere |
| User-Agent / паттерн | Cohere-AI/1.0 (официальный) и cohere-training-data-crawler (встречается в независимых каталогах и антибот-системах) — при настройке правил стоит перекрыть оба |
| robots.txt | По независимым данным, Cohere в целом относится к операторам, уважающим robots.txt — в отличие от многих других записей энциклопедии, здесь файл действительно имеет практический смысл |
| Влияние на классический SEO | Блокировка не затрагивает индексацию в Google/Yandex — это подтверждают независимые источники, а не только предположение |
| Пометка TrafficVeil | Нежелательный / AI и LLM-краулеры |
2. Зачем Cohere Training Data Crawler приходит на сайт
- сбор публичного текста для обучающих корпусов, которые используются при тренировке и дообучении языковых моделей Cohere;
- охват обычно широкий и не привязан к конкретному запросу пользователя — это классический training-краулер, а не user-triggered fetcher вроде ChatGPT-User;
- как и у большинства AI data scraper-ов, паттерн выбора сайтов и частоты обхода компанией публично не раскрывается.
Типичный кейс из черновика — системный обход /blog/, /product/, /category/, /news/ и пагинации каталога по ночам без конверсий — полностью соответствует ожидаемому поведению training-краулера такого типа.
3. Нагрузка и риски
Здесь черновик в целом прав: главный риск — не нагрузка на сервер, а то, что уникальные тексты, описания товаров и статьи уходят в обучающий корпус коммерческой AI-компании без кликов, атрибуции и какой-либо компенсации. Это стандартный риск-профиль для training-краулеров (в отличие, например, от search/retrieval-краулеров вроде тех же ChatGPT-User или PerplexityBot, которые могут приводить реферальный трафик).
Стоит отдельно учитывать вторичный эффект: если контент сайта в итоге используется для обучения моделей, которые впоследствии питают AI-поиск, блокировка может слегка снижать долгосрочную «видимость» в AI-генерируемых ответах — но это не аргумент против блокировки самой по себе, а лишь фактор для взвешенного решения.
4. Как найти Cohere Training Data Crawler в логах
# Базовый поиск — оба варианта токена
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов Cohere в открытых источниках не найдено — для решения allow/deny смотрите связку UA + IP/ASN + системный, широкий паттерн обхода, типичный именно для training-краулера:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Cohere Training Data Crawler
# Жёсткий запрет по обоим известным вариантам токена
User-agent: cohere-ai
Disallow: /
User-agent: cohere-training-data-crawler
Disallow: /
# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в обучающих корпусах
User-agent: cohere-ai
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cohere-ai
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
return 403;
}
limit_req_zone $binary_remote_addr zone=cohereai:10m rate=10r/m;
location / {
if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
limit_req zone=cohereai burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cohere-training-data-crawler [NC,OR]
RewriteCond %{HTTP_USER_AGENT} cohere-ai [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите оба варианта токена в разделе ботов домена или в /system/bots;
- для подавляющего большинства сайтов — Disallow/запрет обоснованы сразу, поскольку прямой пользы от training-краулера почти никогда нет;
- поскольку Cohere в целом относится к операторам, уважающим robots.txt, файл здесь — не просто формальность, как для многих других записей энциклопедии;
- после изменения сверьте логи: хиты по обоим токенам должны уйти в блок/лимит, а Google/Yandex остаться без изменений.
7. Что делать: короткий алгоритм
- Пользы нет — Disallow/403 по обоим известным токенам, это рекомендуемый вариант по умолчанию;
- Хотите разрешить AI-поиск, но не training — по аналогии с другими AI-компаниями стоит уточнить, публикует ли Cohere отдельный UA для retrieval-сценариев (на момент написания статьи такой отдельный токен не задокументирован независимо от training-краулера);
- Нагрузка заметна — rate-limit как промежуточный шаг, хотя для большинства сайтов достаточно сразу Disallow;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. С кем не путать Cohere Training Data Crawler
| Бот / сосед | Кластер | Комментарий |
| AnthropicBot (anthropic-ai) | AI и LLM-краулеры | Официальный training-краулер Anthropic — тот же тип риска, другой оператор |
| AI2Bot / AI2Bot-Dolma | AI и LLM-краулеры | Некоммерческие training-краулеры Allen Institute for AI |
| ChatGPT-User | AI и LLM-краулеры | Принципиально другой тип — user-triggered fetcher, а не training-краулер; иная логика риска |
| AzureAI-SearchBot | AI и LLM-краулеры | Retrieval/search-краулер Microsoft, а не training — тоже стоит различать по типу, а не только по названию оператора |
9. Стратегия allow/deny для Cohere Training Data Crawler
| Ситуация | Действие |
| Обычный сайт, пользы от обучения чужой LLM нет | Disallow по обоим токенам + запрет в TrafficVeil |
| Сайт сознательно хочет присутствовать в обучающих корпусах Cohere | Allow — редкий, но возможный осознанный сценарий |
| Нагрузка заметна | Rate-limit как промежуточная мера |
| Хотите отличать training от search/retrieval трафика Cohere | На данный момент отдельного официального retrieval-токена не задокументировано — относиться ко всему трафику как к training |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и системный, широкий паттерн обхода |