Боты7 мин чтения·10 августа 2026 г.

Один Disallow — десятки ИИ-компаний: масштаб CCBot

Данные Common Crawl легли в основу обучения GPT, LLaMA, Mistral и множества других моделей одновременно. Разбираем, почему архив 2007 года меняет смысл «свежей» блокировки и какой у неё двойной эффект.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота CCBot: нежелательный прочие краулеры и сервисы

CCBot — краулер организации Common Crawl (некоммерческий фонд, зарегистрированный как 501(c)(3) в США). Собирает выборку веба в открытые датасеты, которые используют research, NLP и многие AI-проекты. Это не Googlebot: попадание в Common Crawl ≠ позиция в Google.

Параметры

Параметр Значение
User-Agent CCBot/2.0 (https://commoncrawl.org/faq/) (встречается и с +https://...)
Токен robots CCBot
Оператор Common Crawl
Docs / FAQ commoncrawl.org/faq
IP JSON index.commoncrawl.org/ccbot.json
rDNS *.crawl.commoncrawl.org (выделенные диапазоны); дополнительно трафик исторически наблюдался с IP Amazon AWS
robots.txt Да; поддерживается и нестандартная директива Crawl-delay. Независимые разборы AI-краулеров отдельно отмечают: сопоставимых с Perplexity или Bytespider задокументированных случаев массового нарушения директив у CCBot не найдено — репутация соблюдения сравнительно бесспорная
JS / cookies Не исполняет JS, cookies не использует

Масштаб: одно решение затрагивает десятки компаний разом

CCBot — не рядовой AI-краулер, работающий на одну компанию. Датасеты Common Crawl превышают 250 миллиардов заархивированных страниц с момента основания, обновляются ежемесячно и свободно доступны для скачивания кому угодно. Их данные легли в основу обучающих корпусов практически всех крупных языковых моделей — GPT-2, GPT-3, GPT-4, LLaMA, Mistral и многих других, а среди компаний, использующих эти датасеты, называют OpenAI, Meta, Google, Mistral, Cohere, AI2 и ряд других. Блокировка CCBot — редкий случай, когда одна директива в robots.txt разом исключает сайт из тренировочного пайплайна множества независимых организаций, а не одной конкретной компании.

Историческая оговорка: архивы начинаются с 2007 года

Common Crawl ведёт архив с 2007 года — задолго до того, как блокировка ИИ-краулеров через robots.txt стала массовой практикой. Если сайт долгое время не запрещал CCBot явно, его исторические снимки уже могли попасть в прошлые релизы датасета и в обучающие корпусы, построенные на их основе. Свежий Disallow не отменяет уже случившегося — он лишь предотвращает включение контента в будущие ежемесячные релизы.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Двойной эффект блокировки — не только про AI

Официальный блог Common Crawl прямо предупреждает: блокировка CCBot убирает контент не только из обучающих корпусов ИИ, но и из данных, которые некоторые сторонние проекты используют для собственного поискового индексирования, построенного поверх датасетов Common Crawl. Это может немного повлиять на обнаруживаемость сайта в таких смежных инструментах — стоит учитывать это как небольшой побочный эффект, а не считать блокировку исключительно нейтральным AI-opt-out действием.

Зачем он ходит

Датасеты Common Crawl публичны и переиспользуются широко (в т.ч. для обучения моделей третьими сторонами). Disallow CCBot — стандартный способ не попадать в эти дампы. Есть также добровольный opt-out registry у Common Crawl (см. их blog/FAQ) — можно обратиться напрямую, если нужна дополнительная гарантия исключения. Не путать с ArchiveTeam ArchiveBot и с archive.org_bot Internet Archive — другие операторы и политики.

Нагрузка

По сводке TrafficVeil паттерн ccbot — порядка 17 тысяч запросов (март почти нулевой, рост с апреля; июнь по 14.06 ~4,9 тыс.). Официально — adaptive back-off при 429/5xx: краулер сам снижает частоту запросов, если сервер сигнализирует о перегрузке.

Логи и IP

grep -i "CCBot" /var/log/nginx/access.log
curl -s https://index.commoncrawl.org/ccbot.json
host 18.97.14.84
# ожидаемо: *.crawl.commoncrawl.org → тот же IP

Проверка: IP из JSON и forward/reverse DNS на crawl.commoncrawl.org. Учитывайте распространённую проблему: CDN и edge-защита иногда блокируют легитимный трафик CCBot ещё до того, как он успевает запросить robots.txt — если видите отсутствие визитов там, где ожидали, проверьте не только правила robots.txt, но и настройки WAF/CDN.

robots.txt

User-agent: CCBot
Crawl-delay: 2
User-agent: CCBot
Disallow: /

После Disallow краулер периодически перечитывает robots.txt. Sitemap в robots помогает, если вы хотите более полное покрытие выборкой — а если планируете разрешить обход, дополнительно стоит следить за чёткостью структурированных данных и meta-описаний: это улучшает качество сигналов для тех, кто позже использует датасет.

Nginx / TrafficVeil

if ($http_user_agent ~* "CCBot") {
    return 403;
}
  • Не хотите открытые датасеты / AI-переиспользование — Disallow CCBot + deny, помня об историческом охвате с 2007 года
  • Нужен research-доступ — Allow + при необходимости Crawl-delay
  • На ранжирование Google не влияет

Стратегия

Цель Действие
Opt-out из Common Crawl Disallow CCBot (+ опционально registry для дополнительной гарантии)
Снизить частоту Crawl-delay
Пустить Allow; верификация по ccbot.json и reverse DNS на crawl.commoncrawl.org

Частые вопросы

Почему блокировка CCBot затрагивает сразу много ИИ-компаний?
Потому что открытые датасеты Common Crawl переиспользуются десятками независимых организаций — OpenAI, Meta, Google, Mistral и другими — а не питают пайплайн одной компании, как большинство AI-краулеров.
Уберёт ли новая блокировка сайт из уже выпущенных датасетов?
Нет, архив ведётся с 2007 года, и если сайт долго не запрещал CCBot, его старые снимки уже могли попасть в прошлые релизы и обучающие корпусы — свежий Disallow действует только на будущее.
Влияет ли блокировка CCBot только на обучение ИИ?
Не только: официальный блог Common Crawl предупреждает, что это может также немного повлиять на обнаруживаемость сайта в сторонних поисковых инструментах, построенных поверх их датасетов.
Насколько надёжно CCBot соблюдает robots.txt по сравнению с другими AI-краулерами?
Заметно надёжнее многих: независимые разборы не находят сопоставимых с Perplexity или Bytespider случаев масштабного нарушения директив.
Как проверить, что запрос действительно от CCBot, а не подделка?
Сверить IP с официальным JSON на index.commoncrawl.org/ccbot.json и с reverse DNS на crawl.commoncrawl.org.
Что делать, если CCBot не появляется в логах, хотя доступ разрешён?
Проверить настройки CDN и WAF — они иногда блокируют легитимный трафик ещё до того, как краулер успевает запросить robots.txt.
#CCBot#Common Crawl#открытые датасеты#обучение ИИ#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil