Боты5 мин чтения·11 августа 2026 г.·обновлено 8 сентября 2026 г.

Cohere-ai: обучающий краулер или пользовательский фетч — источники расходятся во мнениях

Открытые каталоги ботов расходятся в трактовке токена cohere-ai: часть считает его прямым обучающим краулером Cohere, другие — неподтверждённым пользовательским агентом, отдельным от точно задокументированного cohere-training-data-crawler. Разбираем эту путаницу честно, объясняем, почему она практически важна для решения о доступе, и даём рекомендации на случай обеих трактовок.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота CohereBot: нежелательный бот

Прежде чем относить cohere-ai однозначно к «обучающим краулерам», стоит отметить: открытые источники расходятся в том, что именно это за токен. Часть каталогов ботов описывает его как прямой обучающий краулер компании Cohere — канадского разработчика корпоративных языковых моделей — с полной строкой Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/). Другие профильные трекеры, включая известный реестр Dark Visitors, описывают его иначе: как неподтверждённого агента, предположительно отправляемого AI-чат-продуктами Cohere в ответ на запрос конкретного пользователя, — и явно отделяют его от отдельного, уже подтверждённого токена cohere-training-data-crawler, который однозначно задокументирован как обучающий краулер.

Кто такая Cohere и зачем ей вообще нужен краулер

Cohere — компания корпоративного сегмента, разрабатывающая большие языковые модели для бизнес-клиентов: API для генерации текста, эмбеддингов для семантического поиска, переранжирования результатов поиска и чат-подобных взаимодействий через модель Command. В отличие от потребительских продуктов вроде ChatGPT, Cohere ориентирована именно на API и интеграции для бизнеса — среди партнёров называют Oracle и Salesforce. Вне зависимости от точной интерпретации конкретного токена, у компании определённо есть подтверждённая потребность в веб-краулинге: обучающие датасеты для языковых моделей нужно на чём-то тренировать, а модель также может нуждаться в свежих данных для функций поиска и ретрив-based ответов.

Параметры

Параметр Значение
User-Agent / паттерн cohere-ai; полная строка по части источников — Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/)
Оператор Cohere — по всем источникам, вопрос лишь в точном назначении именно этого токена
Расхождение в трактовке Часть каталогов считает cohere-ai прямым обучающим краулером; Dark Visitors классифицирует его как неподтверждённый, предположительно пользовательский агент, отдельный от подтверждённого cohere-training-data-crawler
Родственный, точно подтверждённый токен cohere-training-data-crawler — задокументирован как краулер для скачивания обучающих данных, с контактом crawler@cohere.ai в самой строке UA
Соблюдение robots.txt По ряду источников — да, крупные операторы вроде Cohere в целом соблюдают правила; официального публичного подтверждения именно для спорного токена cohere-ai отдельно не найдено
Список IP-адресов ❌ Отдельного официального фида не найдено

Почему эта путаница практически важна

Если предположение о «пользовательском» происхождении cohere-ai верно (то есть бот срабатывает по факту запроса конкретного пользователя AI-продукта Cohere, а не системно обходит веб), это принципиально другая логика допуска, чем для массового обучающего краулера, — ближе к разобранным в этой серии Claude-User или ChatGPT-User, чем к GPTBot. Но поскольку сама Cohere публично не подтверждает и не опровергает эту версию отдельно для токена cohere-ai, действовать стоит по фактическому наблюдаемому поведению в собственных логах, а не по одной из конкурирующих версий классификации.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

# Оба токена семейства Cohere вместе
grep -iE "cohere-ai|cohere-training-data-crawler" /var/log/nginx/access.log

# Проверка паттерна: системный обход или точечные запросы
grep -i "cohere-ai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Если запросы этого конкретного токена выглядят как системный, регулярный обход большого числа URL — это больше похоже на обучающий сбор; если это единичные, разрозненные обращения к конкретным страницам — больше похоже на пользовательский фетч по запросу.

Стоит ли блокировать

  • если цель — не отдавать контент в обучающие датасеты ни при каком толковании токена — можно блокировать оба варианта семейства сразу, не дожидаясь окончательной ясности в классификации;
  • если по наблюдаемому поведению в логах паттерн явно точечный и похож на пользовательский фетч, а не на системный обход, — можно рассмотреть более мягкую политику именно для cohere-ai, оставив жёсткий запрет для подтверждённого cohere-training-data-crawler;
  • на позиции в органической выдаче Google, Bing или Яндекса блокировка любого из этих токенов не влияет — это не поисковые краулеры.

Как настроить robots.txt и сервер

Запрет для обоих токенов семейства — самый однозначный и низкорисковый вариант при отсутствии полной ясности:

User-agent: cohere-ai
Disallow: /

User-agent: cohere-training-data-crawler
Disallow: /
if ($http_user_agent ~* "cohere-ai|cohere-training-data-crawler") {
    return 403;
}

Более щадящий вариант, если по факту логов cohere-ai ведёт себя как точечный пользовательский фетч, а не системный обход:

limit_req_zone $binary_remote_addr zone=cohereai:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "cohere-ai") {
        limit_req zone=cohereai burst=20 nodelay;
    }
}

Частые вопросы

cohere-ai — это точно обучающий краулер?
Однозначного ответа нет — часть каталогов считает его прямым обучающим ботом, другие классифицируют как неподтверждённый пользовательский агент.
Чем cohere-ai отличается от cohere-training-data-crawler?
Последний однозначно задокументирован как краулер для скачивания обучающих данных с контактным email в самой строке UA, тогда как статус cohere-ai менее ясен.
Чем занимается компания Cohere?
Разрабатывает корпоративные языковые модели — API для генерации текста, эмбеддингов, семантического поиска и чат-взаимодействий, ориентированные на бизнес-клиентов.
Как понять, какой перед вами вариант, по логам?
Системный регулярный обход множества URL больше похож на обучающий сбор; единичные точечные обращения к конкретным страницам — больше похожи на пользовательский фетч по запросу.
Стоит ли блокировать оба токена сразу?
Это самый однозначный и низкорисковый вариант при отсутствии полной ясности в классификации — особенно если цель полностью исключить контент из обучающих датасетов.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, ни один из этих токенов не связан с поисковой индексацией Google, Bing или Яндекса.
#cohere-ai#Cohere#cohere-training-data-crawler#AI-краулер#бот-энциклопедия#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil