CCBot — краулер организации Common Crawl (некоммерческий фонд, зарегистрированный как 501(c)(3) в США). Собирает выборку веба в открытые датасеты, которые используют research, NLP и многие AI-проекты. Это не Googlebot: попадание в Common Crawl ≠ позиция в Google.
Параметры
| Параметр | Значение |
|---|---|
| User-Agent | CCBot/2.0 (https://commoncrawl.org/faq/) (встречается и с +https://...) |
| Токен robots | CCBot |
| Оператор | Common Crawl |
| Docs / FAQ | commoncrawl.org/faq |
| IP JSON | index.commoncrawl.org/ccbot.json |
| rDNS | *.crawl.commoncrawl.org (выделенные диапазоны); дополнительно трафик исторически наблюдался с IP Amazon AWS |
| robots.txt | Да; поддерживается и нестандартная директива Crawl-delay. Независимые разборы AI-краулеров отдельно отмечают: сопоставимых с Perplexity или Bytespider задокументированных случаев массового нарушения директив у CCBot не найдено — репутация соблюдения сравнительно бесспорная |
| JS / cookies | Не исполняет JS, cookies не использует |
Масштаб: одно решение затрагивает десятки компаний разом
CCBot — не рядовой AI-краулер, работающий на одну компанию. Датасеты Common Crawl превышают 250 миллиардов заархивированных страниц с момента основания, обновляются ежемесячно и свободно доступны для скачивания кому угодно. Их данные легли в основу обучающих корпусов практически всех крупных языковых моделей — GPT-2, GPT-3, GPT-4, LLaMA, Mistral и многих других, а среди компаний, использующих эти датасеты, называют OpenAI, Meta, Google, Mistral, Cohere, AI2 и ряд других. Блокировка CCBot — редкий случай, когда одна директива в robots.txt разом исключает сайт из тренировочного пайплайна множества независимых организаций, а не одной конкретной компании.
Историческая оговорка: архивы начинаются с 2007 года
Common Crawl ведёт архив с 2007 года — задолго до того, как блокировка ИИ-краулеров через robots.txt стала массовой практикой. Если сайт долгое время не запрещал CCBot явно, его исторические снимки уже могли попасть в прошлые релизы датасета и в обучающие корпусы, построенные на их основе. Свежий Disallow не отменяет уже случившегося — он лишь предотвращает включение контента в будущие ежемесячные релизы.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Двойной эффект блокировки — не только про AI
Официальный блог Common Crawl прямо предупреждает: блокировка CCBot убирает контент не только из обучающих корпусов ИИ, но и из данных, которые некоторые сторонние проекты используют для собственного поискового индексирования, построенного поверх датасетов Common Crawl. Это может немного повлиять на обнаруживаемость сайта в таких смежных инструментах — стоит учитывать это как небольшой побочный эффект, а не считать блокировку исключительно нейтральным AI-opt-out действием.
Зачем он ходит
Датасеты Common Crawl публичны и переиспользуются широко (в т.ч. для обучения моделей третьими сторонами). Disallow CCBot — стандартный способ не попадать в эти дампы. Есть также добровольный opt-out registry у Common Crawl (см. их blog/FAQ) — можно обратиться напрямую, если нужна дополнительная гарантия исключения. Не путать с ArchiveTeam ArchiveBot и с archive.org_bot Internet Archive — другие операторы и политики.
Нагрузка
По сводке TrafficVeil паттерн ccbot — порядка 17 тысяч запросов (март почти нулевой, рост с апреля; июнь по 14.06 ~4,9 тыс.). Официально — adaptive back-off при 429/5xx: краулер сам снижает частоту запросов, если сервер сигнализирует о перегрузке.
Логи и IP
grep -i "CCBot" /var/log/nginx/access.log
curl -s https://index.commoncrawl.org/ccbot.json
host 18.97.14.84
# ожидаемо: *.crawl.commoncrawl.org → тот же IP
Проверка: IP из JSON и forward/reverse DNS на crawl.commoncrawl.org. Учитывайте распространённую проблему: CDN и edge-защита иногда блокируют легитимный трафик CCBot ещё до того, как он успевает запросить robots.txt — если видите отсутствие визитов там, где ожидали, проверьте не только правила robots.txt, но и настройки WAF/CDN.
robots.txt
User-agent: CCBot
Crawl-delay: 2
User-agent: CCBot
Disallow: /
После Disallow краулер периодически перечитывает robots.txt. Sitemap в robots помогает, если вы хотите более полное покрытие выборкой — а если планируете разрешить обход, дополнительно стоит следить за чёткостью структурированных данных и meta-описаний: это улучшает качество сигналов для тех, кто позже использует датасет.
Nginx / TrafficVeil
if ($http_user_agent ~* "CCBot") {
return 403;
}
- Не хотите открытые датасеты / AI-переиспользование — Disallow CCBot + deny, помня об историческом охвате с 2007 года
- Нужен research-доступ — Allow + при необходимости Crawl-delay
- На ранжирование Google не влияет
Стратегия
| Цель | Действие |
|---|---|
| Opt-out из Common Crawl | Disallow CCBot (+ опционально registry для дополнительной гарантии) |
| Снизить частоту | Crawl-delay |
| Пустить | Allow; верификация по ccbot.json и reverse DNS на crawl.commoncrawl.org |
Частые вопросы
Почему блокировка CCBot затрагивает сразу много ИИ-компаний?
Уберёт ли новая блокировка сайт из уже выпущенных датасетов?
Влияет ли блокировка CCBot только на обучение ИИ?
Насколько надёжно CCBot соблюдает robots.txt по сравнению с другими AI-краулерами?
Как проверить, что запрос действительно от CCBot, а не подделка?
Что делать, если CCBot не появляется в логах, хотя доступ разрешён?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.