Боты6 мин чтения·23 августа 2026 г.

Cotoyogi: AI-краулер без установленного оператора

У Cotoyogi нет официальной документации или контактов оператора, но его классификация как training-краулера для обучения AI-моделей независимо повторяется сразу в нескольких разных каталогах ботов — более надёжный сигнал, чем совпадение в одном общем списке. Разбираемся, почему это меняет уровень доверия к оценке риска и почему блокировка здесь остаётся единственным доступным способом реагирования при отсутствии канала связи с оператором.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Cotoyogi: нежелательный прочие краулеры и сервисы

Cotoyogi — случай, отличающийся от многих других статей этой серии: у бота нет установленного оператора с официальной документацией, но, в отличие от совсем неподтверждённых записей вроде «SEO Robot», его классификация как AI-краулера для обучения моделей независимо повторяется сразу в нескольких разных источниках, а не в одном общем списке.

1. Что такое Cotoyogi на самом деле

Cotoyogi фигурирует одновременно в нескольких независимых, разными людьми поддерживаемых каталогах AI-краулеров: в масштабном community-проекте ai-robots-txt на GitHub, в списке Fili (бывшего инженера Google) на robotstxt.com, а также в независимых каталогах наподобие crawlercheck.com. Все они относят Cotoyogi к одной и той же категории — краулер, который собирает текстовые данные из интернета для обучения и дообучения AI/LLM-моделей. Один источник (robotstxt.com) прямо называет его «японским исследовательским краулером», хотя эта характеристика нигде больше независимо не подтверждается, и точное название компании или организации-оператора публично не установлено.

Такая согласованность между разными, независимо составленными списками — более сильный сигнал, чем совпадение в одном общем блоклисте (как это было с «SEO Robot» или «Content Optimizer», где токен фигурировал только в одном источнике без каких-либо перекрёстных подтверждений).

Параметр Значение
Название Cotoyogi
Оператор Не установлен официально; один источник называет его «японским исследовательским краулером», но название конкретной организации не подтверждено
Роль Сбор текстовых данных из открытого веба для обучения/дообучения AI-моделей — классификация повторяется независимо в нескольких разных каталогах ботов
User-Agent / паттерн cotoyogi
Официальная документация Не найдена — ни собственного сайта, ни страницы bot.html, ни контактов оператора
robots.txt Прямых данных о фактическом соблюдении нет; общей практикой считается добавление токена в стандартные блоклисты AI-краулеров
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы — категория, вероятно, точнее звучала бы как «AI и LLM-краулеры» (см. раздел 8)

2. Зачем Cotoyogi приходит на сайт

  • если классификация независимых источников верна — системный сбор текстового контента для обучающих датасетов AI-моделей;
  • обход, судя по всему, широкий и не привязан к конкретному пользовательскому запросу — типичное поведение training-краулера, а не user-triggered fetcher-а;
  • публичная общедоступность контента, судя по всему, единственный критерий отбора — не тематическая избирательность.

Типичный кейс: системный обход публичных страниц сайта — блога, каталога, новостного раздела — без концентрации на конкретных, только что упомянутых где-то URL. Такой паттерн отличает training-краулер от user-triggered fetcher-ов вроде ChatGPT-User, которые запрашивают конкретные страницы по прямому указанию пользователя.

3. Нагрузка и риски

Поскольку независимая классификация нескольких источников сходится на training-назначении, риск-профиль здесь стандартный для этой категории: уникальные тексты и контент сайта потенциально уходят в обучающий корпус без кликов, атрибуции и компенсации владельцу сайта. Прямой пользы для владельца сайта, как правило, нет.

Отдельный, специфичный именно для этого случая риск — отсутствие официального канала связи с оператором: при возникновении проблем (например, нежелательного использования конкретного контента) нет ни email, ни формы обратной связи, ни страницы с политикой — только техническая блокировка остаётся доступным инструментом реагирования.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти Cotoyogi в логах

# Базовый поиск
grep -i "cotoyogi" /var/log/nginx/access.log

# Топ URL — ожидаем широкий, не точечный охват при подтверждении training-паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверка ширины охвата — признак training vs user-triggered паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort -u | wc -l

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов нет — для решения allow/deny смотрите связку UA + IP/ASN + широкий, системный паттерн обхода, характерный для training-краулера:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Cotoyogi

# Жёсткий запрет — рекомендуемый вариант по умолчанию
User-agent: cotoyogi
Disallow: /

# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в AI-корпусах
User-agent: cotoyogi
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cotoyogi
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "cotoyogi") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=cotoyogi:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "cotoyogi") {
        limit_req zone=cotoyogi burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cotoyogi [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите cotoyogi в разделе ботов домена или в /system/bots;
  • поскольку прямой пользы для владельца сайта нет, а официального оператора для связи не установлено — Disallow плюс запрет обоснованы сразу, без промежуточного rate-limit;
  • после изменения сверьте логи: хиты Cotoyogi должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Пользы нет — блокируйте по умолчанию, риск подтверждён независимо несколькими источниками, а не одним неверифицированным списком;
  • Заметен широкий, системный паттерн обхода — это соответствует ожидаемому поведению training-краулера, не повод для дополнительных сомнений в классификации;
  • Хотите связаться с оператором по поводу конкретного случая использования контента — официального канала не найдено, доступна только техническая блокировка;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит рассмотреть перенос Cotoyogi из «Прочие краулеры и сервисы» в «AI и LLM-краулеры» — классификация как training-краулера повторяется независимо в нескольких разных каталогах (ai-robots-txt, robotstxt.com, crawlercheck.com), что заметно надёжнее, чем совпадение в одном общем списке, как это было с рядом других записей в этой энциклопедии («SEO Robot», «Content Optimizer»). При этом стоит сохранить пометку об отсутствии официально подтверждённого оператора — это не отменяет обоснованность блокировки, но говорит о разнице в уровне доказательности между этим случаем и записями с полностью официальной документацией вроде GPTBot или AnthropicBot.

Бот / сосед Кластер Комментарий
GPTBot AI и LLM-краулеры Официально задокументированный training-краулер OpenAI — для контраста в уровне доказательности с Cotoyogi
Cohere Training Data Crawler AI и LLM-краулеры (см. отдельную статью) Тоже training-краулер, но с подтверждённым официальным оператором Cohere — тот же тип риска, разный уровень прозрачности
SEO Robot Требует пересмотра статуса (см. отдельную статью) Для контраста — токен без каких-либо независимых подтверждений, только один неверифицированный источник
Bytespider Не в базе TrafficVeil, но стоит знать Ещё один AI-краулер, тоже регулярно встречающийся в независимых списках наравне с Cotoyogi

9. Стратегия allow/deny для Cotoyogi

Ситуация Действие
Обычный сайт, пользы от AI-обучения чужой модели нет Disallow + запрет в TrafficVeil
Сайт заинтересован в присутствии в открытых AI-корпусах Allow — редкий, но возможный осознанный сценарий
Наблюдаемый паттерн шире ожидаемого Это ожидаемо для training-краулера, не повод дляallow
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и системный, широкий характер обхода

Частые вопросы

Есть ли у Cotoyogi официальный оператор с документацией?
Нет, ни собственного сайта, ни страницы с политикой, ни контактов не найдено — это отличает его от полностью задокументированных ботов вроде GPTBot.
Почему всё же стоит доверять классификации этого бота как AI-краулера?
Потому что она независимо повторяется в нескольких разных, отдельно составленных каталогах ботов, а не в одном общем неверифицированном списке.
Есть ли способ связаться с оператором по поводу использования контента?
Нет, официального канала связи не найдено — доступна только техническая блокировка через robots.txt и серверные правила.
Что означает упоминание «японского исследовательского краулера»?
Это утверждение только одного источника, нигде больше независимо не подтверждённое — стоит относиться к нему как к гипотезе, а не факту.
Стоит ли блокировать Cotoyogi по умолчанию?
Да, для большинства сайтов это обоснованно — прямой пользы от обучения чужой AI-модели, как правило, нет.
Стоит ли пересмотреть категорию Cotoyogi в базе TrafficVeil?
Да, вероятно, её стоит перенести из «Прочие краулеры и сервисы» в «AI и LLM-краулеры», раз назначение подтверждено согласованно несколькими источниками.
#Cotoyogi#AI-краулеры#training data#User-Agent#антибот#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil