Cotoyogi — случай, отличающийся от многих других статей этой серии: у бота нет установленного оператора с официальной документацией, но, в отличие от совсем неподтверждённых записей вроде «SEO Robot», его классификация как AI-краулера для обучения моделей независимо повторяется сразу в нескольких разных источниках, а не в одном общем списке.
1. Что такое Cotoyogi на самом деле
Cotoyogi фигурирует одновременно в нескольких независимых, разными людьми поддерживаемых каталогах AI-краулеров: в масштабном community-проекте ai-robots-txt на GitHub, в списке Fili (бывшего инженера Google) на robotstxt.com, а также в независимых каталогах наподобие crawlercheck.com. Все они относят Cotoyogi к одной и той же категории — краулер, который собирает текстовые данные из интернета для обучения и дообучения AI/LLM-моделей. Один источник (robotstxt.com) прямо называет его «японским исследовательским краулером», хотя эта характеристика нигде больше независимо не подтверждается, и точное название компании или организации-оператора публично не установлено.
Такая согласованность между разными, независимо составленными списками — более сильный сигнал, чем совпадение в одном общем блоклисте (как это было с «SEO Robot» или «Content Optimizer», где токен фигурировал только в одном источнике без каких-либо перекрёстных подтверждений).
| Параметр | Значение |
| Название | Cotoyogi |
| Оператор | Не установлен официально; один источник называет его «японским исследовательским краулером», но название конкретной организации не подтверждено |
| Роль | Сбор текстовых данных из открытого веба для обучения/дообучения AI-моделей — классификация повторяется независимо в нескольких разных каталогах ботов |
| User-Agent / паттерн | cotoyogi |
| Официальная документация | Не найдена — ни собственного сайта, ни страницы bot.html, ни контактов оператора |
| robots.txt | Прямых данных о фактическом соблюдении нет; общей практикой считается добавление токена в стандартные блоклисты AI-краулеров |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы — категория, вероятно, точнее звучала бы как «AI и LLM-краулеры» (см. раздел 8) |
2. Зачем Cotoyogi приходит на сайт
- если классификация независимых источников верна — системный сбор текстового контента для обучающих датасетов AI-моделей;
- обход, судя по всему, широкий и не привязан к конкретному пользовательскому запросу — типичное поведение training-краулера, а не user-triggered fetcher-а;
- публичная общедоступность контента, судя по всему, единственный критерий отбора — не тематическая избирательность.
Типичный кейс: системный обход публичных страниц сайта — блога, каталога, новостного раздела — без концентрации на конкретных, только что упомянутых где-то URL. Такой паттерн отличает training-краулер от user-triggered fetcher-ов вроде ChatGPT-User, которые запрашивают конкретные страницы по прямому указанию пользователя.
3. Нагрузка и риски
Поскольку независимая классификация нескольких источников сходится на training-назначении, риск-профиль здесь стандартный для этой категории: уникальные тексты и контент сайта потенциально уходят в обучающий корпус без кликов, атрибуции и компенсации владельцу сайта. Прямой пользы для владельца сайта, как правило, нет.
Отдельный, специфичный именно для этого случая риск — отсутствие официального канала связи с оператором: при возникновении проблем (например, нежелательного использования конкретного контента) нет ни email, ни формы обратной связи, ни страницы с политикой — только техническая блокировка остаётся доступным инструментом реагирования.
4. Как найти Cotoyogi в логах
# Базовый поиск
grep -i "cotoyogi" /var/log/nginx/access.log
# Топ URL — ожидаем широкий, не точечный охват при подтверждении training-паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверка ширины охвата — признак training vs user-triggered паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort -u | wc -l
Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов нет — для решения allow/deny смотрите связку UA + IP/ASN + широкий, системный паттерн обхода, характерный для training-краулера:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Cotoyogi
# Жёсткий запрет — рекомендуемый вариант по умолчанию
User-agent: cotoyogi
Disallow: /
# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в AI-корпусах
User-agent: cotoyogi
Allow: /
# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cotoyogi
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
6. Блокировка вручную и через TrafficVeil
Nginx:
if ($http_user_agent ~* "cotoyogi") {
return 403;
}
limit_req_zone $binary_remote_addr zone=cotoyogi:10m rate=10r/m;
location / {
if ($http_user_agent ~* "cotoyogi") {
limit_req zone=cotoyogi burst=20 nodelay;
}
}
Apache (.htaccess):
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cotoyogi [NC]
RewriteRule ^ - [F,L]
TrafficVeil:
- найдите cotoyogi в разделе ботов домена или в /system/bots;
- поскольку прямой пользы для владельца сайта нет, а официального оператора для связи не установлено — Disallow плюс запрет обоснованы сразу, без промежуточного rate-limit;
- после изменения сверьте логи: хиты Cotoyogi должны уйти в блок/лимит, а нужные поисковики остаться.
7. Что делать: короткий алгоритм
- Пользы нет — блокируйте по умолчанию, риск подтверждён независимо несколькими источниками, а не одним неверифицированным списком;
- Заметен широкий, системный паттерн обхода — это соответствует ожидаемому поведению training-краулера, не повод для дополнительных сомнений в классификации;
- Хотите связаться с оператором по поводу конкретного случая использования контента — официального канала не найдено, доступна только техническая блокировка;
- Не блокируйте по маске
User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.
8. Открытый вопрос по категоризации
Стоит рассмотреть перенос Cotoyogi из «Прочие краулеры и сервисы» в «AI и LLM-краулеры» — классификация как training-краулера повторяется независимо в нескольких разных каталогах (ai-robots-txt, robotstxt.com, crawlercheck.com), что заметно надёжнее, чем совпадение в одном общем списке, как это было с рядом других записей в этой энциклопедии («SEO Robot», «Content Optimizer»). При этом стоит сохранить пометку об отсутствии официально подтверждённого оператора — это не отменяет обоснованность блокировки, но говорит о разнице в уровне доказательности между этим случаем и записями с полностью официальной документацией вроде GPTBot или AnthropicBot.
| Бот / сосед | Кластер | Комментарий |
| GPTBot | AI и LLM-краулеры | Официально задокументированный training-краулер OpenAI — для контраста в уровне доказательности с Cotoyogi |
| Cohere Training Data Crawler | AI и LLM-краулеры (см. отдельную статью) | Тоже training-краулер, но с подтверждённым официальным оператором Cohere — тот же тип риска, разный уровень прозрачности |
| SEO Robot | Требует пересмотра статуса (см. отдельную статью) | Для контраста — токен без каких-либо независимых подтверждений, только один неверифицированный источник |
| Bytespider | Не в базе TrafficVeil, но стоит знать | Ещё один AI-краулер, тоже регулярно встречающийся в независимых списках наравне с Cotoyogi |
9. Стратегия allow/deny для Cotoyogi
| Ситуация | Действие |
| Обычный сайт, пользы от AI-обучения чужой модели нет | Disallow + запрет в TrafficVeil |
| Сайт заинтересован в присутствии в открытых AI-корпусах | Allow — редкий, но возможный осознанный сценарий |
| Наблюдаемый паттерн шире ожидаемого | Это ожидаемо для training-краулера, не повод дляallow |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и системный, широкий характер обхода |