Прежде чем относить cohere-ai однозначно к «обучающим краулерам», стоит отметить: открытые источники расходятся в том, что именно это за токен. Часть каталогов ботов описывает его как прямой обучающий краулер компании Cohere — канадского разработчика корпоративных языковых моделей — с полной строкой Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/). Другие профильные трекеры, включая известный реестр Dark Visitors, описывают его иначе: как неподтверждённого агента, предположительно отправляемого AI-чат-продуктами Cohere в ответ на запрос конкретного пользователя, — и явно отделяют его от отдельного, уже подтверждённого токена cohere-training-data-crawler, который однозначно задокументирован как обучающий краулер.
Кто такая Cohere и зачем ей вообще нужен краулер
Cohere — компания корпоративного сегмента, разрабатывающая большие языковые модели для бизнес-клиентов: API для генерации текста, эмбеддингов для семантического поиска, переранжирования результатов поиска и чат-подобных взаимодействий через модель Command. В отличие от потребительских продуктов вроде ChatGPT, Cohere ориентирована именно на API и интеграции для бизнеса — среди партнёров называют Oracle и Salesforce. Вне зависимости от точной интерпретации конкретного токена, у компании определённо есть подтверждённая потребность в веб-краулинге: обучающие датасеты для языковых моделей нужно на чём-то тренировать, а модель также может нуждаться в свежих данных для функций поиска и ретрив-based ответов.
Параметры
| Параметр | Значение |
| User-Agent / паттерн | cohere-ai; полная строка по части источников — Mozilla/5.0 (compatible; Cohere-AI/1.0; +https://cohere.com/) |
| Оператор | Cohere — по всем источникам, вопрос лишь в точном назначении именно этого токена |
| Расхождение в трактовке | Часть каталогов считает cohere-ai прямым обучающим краулером; Dark Visitors классифицирует его как неподтверждённый, предположительно пользовательский агент, отдельный от подтверждённого cohere-training-data-crawler |
| Родственный, точно подтверждённый токен | cohere-training-data-crawler — задокументирован как краулер для скачивания обучающих данных, с контактом crawler@cohere.ai в самой строке UA |
| Соблюдение robots.txt | По ряду источников — да, крупные операторы вроде Cohere в целом соблюдают правила; официального публичного подтверждения именно для спорного токена cohere-ai отдельно не найдено |
| Список IP-адресов | ❌ Отдельного официального фида не найдено |
Почему эта путаница практически важна
Если предположение о «пользовательском» происхождении cohere-ai верно (то есть бот срабатывает по факту запроса конкретного пользователя AI-продукта Cohere, а не системно обходит веб), это принципиально другая логика допуска, чем для массового обучающего краулера, — ближе к разобранным в этой серии Claude-User или ChatGPT-User, чем к GPTBot. Но поскольку сама Cohere публично не подтверждает и не опровергает эту версию отдельно для токена cohere-ai, действовать стоит по фактическому наблюдаемому поведению в собственных логах, а не по одной из конкурирующих версий классификации.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Оба токена семейства Cohere вместе
grep -iE "cohere-ai|cohere-training-data-crawler" /var/log/nginx/access.log
# Проверка паттерна: системный обход или точечные запросы
grep -i "cohere-ai" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Если запросы этого конкретного токена выглядят как системный, регулярный обход большого числа URL — это больше похоже на обучающий сбор; если это единичные, разрозненные обращения к конкретным страницам — больше похоже на пользовательский фетч по запросу.
Стоит ли блокировать
- если цель — не отдавать контент в обучающие датасеты ни при каком толковании токена — можно блокировать оба варианта семейства сразу, не дожидаясь окончательной ясности в классификации;
- если по наблюдаемому поведению в логах паттерн явно точечный и похож на пользовательский фетч, а не на системный обход, — можно рассмотреть более мягкую политику именно для cohere-ai, оставив жёсткий запрет для подтверждённого cohere-training-data-crawler;
- на позиции в органической выдаче Google, Bing или Яндекса блокировка любого из этих токенов не влияет — это не поисковые краулеры.
Как настроить robots.txt и сервер
Запрет для обоих токенов семейства — самый однозначный и низкорисковый вариант при отсутствии полной ясности:
User-agent: cohere-ai
Disallow: /
User-agent: cohere-training-data-crawler
Disallow: /
if ($http_user_agent ~* "cohere-ai|cohere-training-data-crawler") {
return 403;
}
Более щадящий вариант, если по факту логов cohere-ai ведёт себя как точечный пользовательский фетч, а не системный обход:
limit_req_zone $binary_remote_addr zone=cohereai:10m rate=10r/m;
location / {
if ($http_user_agent ~* "cohere-ai") {
limit_req zone=cohereai burst=20 nodelay;
}
}- AhrefsBot: полное руководство
- Googlebot: полное руководство
- Googlebot-Image
- Googlebot-News
- Googlebot-Video
- Google AdsBot
- Storebot-Google
- Mediapartners-Google (AdSense)
- Feedfetcher-Google
- APIs-Google
- Google-Read-Aloud
- Google-Site-Verification и InspectionTool
- Bingbot (MSN Bot)
- YandexBot
- YandexMetrika
- Yandex Userproxy
- MJ12bot
- SemrushBot
- Amazonbot
- DotBot
- FacebookBot
- Amazon SearchBot
- Yandex Direct Fetcher
- Anthropic AI
- llmstxtscan
- HetrixTools
- ArchiveTeam ArchiveBot
- HeadlessChrome
- crawler_eb
- EECS498
- IntelX
- statdom.ru
- Website-info.net-Robot
Частые вопросы
cohere-ai — это точно обучающий краулер?
Чем cohere-ai отличается от cohere-training-data-crawler?
Чем занимается компания Cohere?
Как понять, какой перед вами вариант, по логам?
Стоит ли блокировать оба токена сразу?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.