TrafficVeil
Боты 7 мин21 августа 2026 г.

Cohere Training Data Crawler: известный training-бот enterprise AI

Cohere — не безымянный оператор, а известная компания корпоративных языковых моделей, и её краулер официально задокументирован под именем Cohere-AI. Разбираемся, почему в логах стоит искать сразу два связанных токена, чтобы не упустить часть трафика, и почему здесь, в отличие от многих других ботов, robots.txt действительно работает.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Cohere Training Data Crawler на самом деле
  2. 2. Зачем Cohere Training Data Crawler приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти Cohere Training Data Crawler в логах
  5. 5. robots.txt для Cohere Training Data Crawler
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать Cohere Training Data Crawler
  9. 9. Стратегия allow/deny для Cohere Training Data Crawler
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В отличие от многих записей в этой энциклопедии, оценка риска в черновике для Cohere Training Data Crawler в целом верна — но формулировка «оператор не указан публично» здесь не соответствует действительности. Cohere — крупная, хорошо известная компания в сфере корпоративных языковых моделей (cohere.com), и её краулер официально задокументирован под собственным именем.

1. Что такое Cohere Training Data Crawler на самом деле

Cohere — один из заметных игроков рынка enterprise LLM, наравне с OpenAI и Anthropic, но ориентированный именно на бизнес-заказчиков. Официальный краулер компании собирает публичный контент для обучения языковых моделей, которые затем продаются как часть корпоративных AI-продуктов Cohere.

Официальный User-Agent:

Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/)

Важный нюанс, которого нет в черновике: в открытых источниках встречаются два разных, но, по всей видимости, связанных токена — краткий cohere-ai (используется в официальной строке UA и большинстве современных гайдов по robots.txt) и более описательный cohere-training-data-crawler, который фигурирует в независимых каталогах ботов и системах защиты вроде DataDome. Чтобы не упустить часть трафика, при настройке правил разумно перекрыть оба варианта.

Параметр Значение
Название Cohere Training Data Crawler (он же Cohere-AI)
Оператор Cohere — официально задокументированная компания-разработчик enterprise LLM, cohere.com
Роль Сбор публичного текстового контента для обучения языковых моделей Cohere
User-Agent / паттерн Cohere-AI/1.0 (официальный) и cohere-training-data-crawler (встречается в независимых каталогах и антибот-системах) — при настройке правил стоит перекрыть оба
robots.txt По независимым данным, Cohere в целом относится к операторам, уважающим robots.txt — в отличие от многих других записей энциклопедии, здесь файл действительно имеет практический смысл
Влияние на классический SEO Блокировка не затрагивает индексацию в Google/Yandex — это подтверждают независимые источники, а не только предположение
Пометка TrafficVeil Нежелательный / AI и LLM-краулеры

2. Зачем Cohere Training Data Crawler приходит на сайт

  • сбор публичного текста для обучающих корпусов, которые используются при тренировке и дообучении языковых моделей Cohere;
  • охват обычно широкий и не привязан к конкретному запросу пользователя — это классический training-краулер, а не user-triggered fetcher вроде ChatGPT-User;
  • как и у большинства AI data scraper-ов, паттерн выбора сайтов и частоты обхода компанией публично не раскрывается.

Типичный кейс из черновика — системный обход /blog/, /product/, /category/, /news/ и пагинации каталога по ночам без конверсий — полностью соответствует ожидаемому поведению training-краулера такого типа.

3. Нагрузка и риски

Здесь черновик в целом прав: главный риск — не нагрузка на сервер, а то, что уникальные тексты, описания товаров и статьи уходят в обучающий корпус коммерческой AI-компании без кликов, атрибуции и какой-либо компенсации. Это стандартный риск-профиль для training-краулеров (в отличие, например, от search/retrieval-краулеров вроде тех же ChatGPT-User или PerplexityBot, которые могут приводить реферальный трафик).

Стоит отдельно учитывать вторичный эффект: если контент сайта в итоге используется для обучения моделей, которые впоследствии питают AI-поиск, блокировка может слегка снижать долгосрочную «видимость» в AI-генерируемых ответах — но это не аргумент против блокировки самой по себе, а лишь фактор для взвешенного решения.

4. Как найти Cohere Training Data Crawler в логах

# Базовый поиск — оба варианта токена
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -iE "cohere-training-data-crawler|cohere-ai" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов Cohere в открытых источниках не найдено — для решения allow/deny смотрите связку UA + IP/ASN + системный, широкий паттерн обхода, типичный именно для training-краулера:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Cohere Training Data Crawler

# Жёсткий запрет по обоим известным вариантам токена
User-agent: cohere-ai
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /

# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в обучающих корпусах
User-agent: cohere-ai
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cohere-ai
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=cohereai:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "cohere-training-data-crawler|cohere-ai") {
        limit_req zone=cohereai burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cohere-training-data-crawler [NC,OR]
RewriteCond %{HTTP_USER_AGENT} cohere-ai [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите оба варианта токена в разделе ботов домена или в /system/bots;
  • для подавляющего большинства сайтов — Disallow/запрет обоснованы сразу, поскольку прямой пользы от training-краулера почти никогда нет;
  • поскольку Cohere в целом относится к операторам, уважающим robots.txt, файл здесь — не просто формальность, как для многих других записей энциклопедии;
  • после изменения сверьте логи: хиты по обоим токенам должны уйти в блок/лимит, а Google/Yandex остаться без изменений.

7. Что делать: короткий алгоритм

  • Пользы нет — Disallow/403 по обоим известным токенам, это рекомендуемый вариант по умолчанию;
  • Хотите разрешить AI-поиск, но не training — по аналогии с другими AI-компаниями стоит уточнить, публикует ли Cohere отдельный UA для retrieval-сценариев (на момент написания статьи такой отдельный токен не задокументирован независимо от training-краулера);
  • Нагрузка заметна — rate-limit как промежуточный шаг, хотя для большинства сайтов достаточно сразу Disallow;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать Cohere Training Data Crawler

Бот / сосед Кластер Комментарий
AnthropicBot (anthropic-ai) AI и LLM-краулеры Официальный training-краулер Anthropic — тот же тип риска, другой оператор
AI2Bot / AI2Bot-Dolma AI и LLM-краулеры Некоммерческие training-краулеры Allen Institute for AI
ChatGPT-User AI и LLM-краулеры Принципиально другой тип — user-triggered fetcher, а не training-краулер; иная логика риска
AzureAI-SearchBot AI и LLM-краулеры Retrieval/search-краулер Microsoft, а не training — тоже стоит различать по типу, а не только по названию оператора

9. Стратегия allow/deny для Cohere Training Data Crawler

Ситуация Действие
Обычный сайт, пользы от обучения чужой LLM нет Disallow по обоим токенам + запрет в TrafficVeil
Сайт сознательно хочет присутствовать в обучающих корпусах Cohere Allow — редкий, но возможный осознанный сценарий
Нагрузка заметна Rate-limit как промежуточная мера
Хотите отличать training от search/retrieval трафика Cohere На данный момент отдельного официального retrieval-токена не задокументировано — относиться ко всему трафику как к training
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и системный, широкий паттерн обхода

Частые вопросы

Cohere Training Data Crawler — это анонимный сборщик данных?

Нет, оператор — Cohere, известная компания в сфере enterprise-языковых моделей, с официально задокументированным краулером.

Почему стоит искать сразу два токена в логах?

Потому что встречаются и официальный cohere-ai, и более описательный cohere-training-data-crawler — оба, по всей видимости, относятся к одному и тому же краулеру.

Работает ли robots.txt против этого краулера?

Да, по независимым данным Cohere в целом уважает правила robots.txt — здесь файл имеет реальный практический смысл.

Повлияет ли блокировка на позиции сайта в Google или Яндексе?

Нет, это подтверждено независимо — блокировка training-краулеров AI-компаний не затрагивает классическую поисковую индексацию.

Чем этот бот отличается от ChatGPT-User или AzureAI-SearchBot?

Это training-краулер, собирающий данные для обучения моделей впрок, а не user-triggered fetcher, работающий по запросу конкретного пользователя в реальном времени.

Стоит ли вообще блокировать Cohere Training Data Crawler?

Для большинства сайтов да — прямой пользы от обучения чужой коммерческой модели практически никогда нет.

#Cohere#Cohere-AI#AI и LLM-краулеры#training data#User-Agent#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.