TrafficVeil
Боты 6 мин23 августа 2026 г.

Cotoyogi: AI-краулер без установленного оператора

У Cotoyogi нет официальной документации или контактов оператора, но его классификация как training-краулера для обучения AI-моделей независимо повторяется сразу в нескольких разных каталогах ботов — более надёжный сигнал, чем совпадение в одном общем списке. Разбираемся, почему это меняет уровень доверия к оценке риска и почему блокировка здесь остаётся единственным доступным способом реагирования при отсутствии канала связи с оператором.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Cotoyogi на самом деле
  2. 2. Зачем Cotoyogi приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти Cotoyogi в логах
  5. 5. robots.txt для Cotoyogi
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для Cotoyogi
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Cotoyogi — случай, отличающийся от многих других статей этой серии: у бота нет установленного оператора с официальной документацией, но, в отличие от совсем неподтверждённых записей вроде «SEO Robot», его классификация как AI-краулера для обучения моделей независимо повторяется сразу в нескольких разных источниках, а не в одном общем списке.

1. Что такое Cotoyogi на самом деле

Cotoyogi фигурирует одновременно в нескольких независимых, разными людьми поддерживаемых каталогах AI-краулеров: в масштабном community-проекте ai-robots-txt на GitHub, в списке Fili (бывшего инженера Google) на robotstxt.com, а также в независимых каталогах наподобие crawlercheck.com. Все они относят Cotoyogi к одной и той же категории — краулер, который собирает текстовые данные из интернета для обучения и дообучения AI/LLM-моделей. Один источник (robotstxt.com) прямо называет его «японским исследовательским краулером», хотя эта характеристика нигде больше независимо не подтверждается, и точное название компании или организации-оператора публично не установлено.

Такая согласованность между разными, независимо составленными списками — более сильный сигнал, чем совпадение в одном общем блоклисте (как это было с «SEO Robot» или «Content Optimizer», где токен фигурировал только в одном источнике без каких-либо перекрёстных подтверждений).

Параметр Значение
Название Cotoyogi
Оператор Не установлен официально; один источник называет его «японским исследовательским краулером», но название конкретной организации не подтверждено
Роль Сбор текстовых данных из открытого веба для обучения/дообучения AI-моделей — классификация повторяется независимо в нескольких разных каталогах ботов
User-Agent / паттерн cotoyogi
Официальная документация Не найдена — ни собственного сайта, ни страницы bot.html, ни контактов оператора
robots.txt Прямых данных о фактическом соблюдении нет; общей практикой считается добавление токена в стандартные блоклисты AI-краулеров
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы — категория, вероятно, точнее звучала бы как «AI и LLM-краулеры» (см. раздел 8)

2. Зачем Cotoyogi приходит на сайт

  • если классификация независимых источников верна — системный сбор текстового контента для обучающих датасетов AI-моделей;
  • обход, судя по всему, широкий и не привязан к конкретному пользовательскому запросу — типичное поведение training-краулера, а не user-triggered fetcher-а;
  • публичная общедоступность контента, судя по всему, единственный критерий отбора — не тематическая избирательность.

Типичный кейс: системный обход публичных страниц сайта — блога, каталога, новостного раздела — без концентрации на конкретных, только что упомянутых где-то URL. Такой паттерн отличает training-краулер от user-triggered fetcher-ов вроде ChatGPT-User, которые запрашивают конкретные страницы по прямому указанию пользователя.

3. Нагрузка и риски

Поскольку независимая классификация нескольких источников сходится на training-назначении, риск-профиль здесь стандартный для этой категории: уникальные тексты и контент сайта потенциально уходят в обучающий корпус без кликов, атрибуции и компенсации владельцу сайта. Прямой пользы для владельца сайта, как правило, нет.

Отдельный, специфичный именно для этого случая риск — отсутствие официального канала связи с оператором: при возникновении проблем (например, нежелательного использования конкретного контента) нет ни email, ни формы обратной связи, ни страницы с политикой — только техническая блокировка остаётся доступным инструментом реагирования.

4. Как найти Cotoyogi в логах

# Базовый поиск
grep -i "cotoyogi" /var/log/nginx/access.log

# Топ URL — ожидаем широкий, не точечный охват при подтверждении training-паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверка ширины охвата — признак training vs user-triggered паттерна
grep -i "cotoyogi" /var/log/nginx/access.log | awk '{print $7}' | sort -u | wc -l

Верификация. Строку UA подделать может любой скрипт. Официального списка IP-диапазонов нет — для решения allow/deny смотрите связку UA + IP/ASN + широкий, системный паттерн обхода, характерный для training-краулера:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Cotoyogi

# Жёсткий запрет — рекомендуемый вариант по умолчанию
User-agent: cotoyogi
Disallow: /

# Разрешить всё — редкий сценарий, если сайт заинтересован в присутствии в AI-корпусах
User-agent: cotoyogi
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: cotoyogi
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную и через TrafficVeil

Nginx:

if ($http_user_agent ~* "cotoyogi") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=cotoyogi:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "cotoyogi") {
        limit_req zone=cotoyogi burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} cotoyogi [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите cotoyogi в разделе ботов домена или в /system/bots;
  • поскольку прямой пользы для владельца сайта нет, а официального оператора для связи не установлено — Disallow плюс запрет обоснованы сразу, без промежуточного rate-limit;
  • после изменения сверьте логи: хиты Cotoyogi должны уйти в блок/лимит, а нужные поисковики остаться.

7. Что делать: короткий алгоритм

  • Пользы нет — блокируйте по умолчанию, риск подтверждён независимо несколькими источниками, а не одним неверифицированным списком;
  • Заметен широкий, системный паттерн обхода — это соответствует ожидаемому поведению training-краулера, не повод для дополнительных сомнений в классификации;
  • Хотите связаться с оператором по поводу конкретного случая использования контента — официального канала не найдено, доступна только техническая блокировка;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. Открытый вопрос по категоризации

Стоит рассмотреть перенос Cotoyogi из «Прочие краулеры и сервисы» в «AI и LLM-краулеры» — классификация как training-краулера повторяется независимо в нескольких разных каталогах (ai-robots-txt, robotstxt.com, crawlercheck.com), что заметно надёжнее, чем совпадение в одном общем списке, как это было с рядом других записей в этой энциклопедии («SEO Robot», «Content Optimizer»). При этом стоит сохранить пометку об отсутствии официально подтверждённого оператора — это не отменяет обоснованность блокировки, но говорит о разнице в уровне доказательности между этим случаем и записями с полностью официальной документацией вроде GPTBot или AnthropicBot.

Бот / сосед Кластер Комментарий
GPTBot AI и LLM-краулеры Официально задокументированный training-краулер OpenAI — для контраста в уровне доказательности с Cotoyogi
Cohere Training Data Crawler AI и LLM-краулеры (см. отдельную статью) Тоже training-краулер, но с подтверждённым официальным оператором Cohere — тот же тип риска, разный уровень прозрачности
SEO Robot Требует пересмотра статуса (см. отдельную статью) Для контраста — токен без каких-либо независимых подтверждений, только один неверифицированный источник
Bytespider Не в базе TrafficVeil, но стоит знать Ещё один AI-краулер, тоже регулярно встречающийся в независимых списках наравне с Cotoyogi

9. Стратегия allow/deny для Cotoyogi

Ситуация Действие
Обычный сайт, пользы от AI-обучения чужой модели нет Disallow + запрет в TrafficVeil
Сайт заинтересован в присутствии в открытых AI-корпусах Allow — редкий, но возможный осознанный сценарий
Наблюдаемый паттерн шире ожидаемого Это ожидаемо для training-краулера, не повод дляallow
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и системный, широкий характер обхода

Частые вопросы

Есть ли у Cotoyogi официальный оператор с документацией?

Нет, ни собственного сайта, ни страницы с политикой, ни контактов не найдено — это отличает его от полностью задокументированных ботов вроде GPTBot.

Почему всё же стоит доверять классификации этого бота как AI-краулера?

Потому что она независимо повторяется в нескольких разных, отдельно составленных каталогах ботов, а не в одном общем неверифицированном списке.

Есть ли способ связаться с оператором по поводу использования контента?

Нет, официального канала связи не найдено — доступна только техническая блокировка через robots.txt и серверные правила.

Что означает упоминание «японского исследовательского краулера»?

Это утверждение только одного источника, нигде больше независимо не подтверждённое — стоит относиться к нему как к гипотезе, а не факту.

Стоит ли блокировать Cotoyogi по умолчанию?

Да, для большинства сайтов это обоснованно — прямой пользы от обучения чужой AI-модели, как правило, нет.

Стоит ли пересмотреть категорию Cotoyogi в базе TrafficVeil?

Да, вероятно, её стоит перенести из «Прочие краулеры и сервисы» в «AI и LLM-краулеры», раз назначение подтверждено согласованно несколькими источниками.

#Cotoyogi#AI-краулеры#training data#User-Agent#антибот#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.