CocCocBot / coccocbot-web — краулеры поисковика и браузера Cốc Cốc, одного из крупнейших локальных интернет-игроков Вьетнама: компания заявляет более 22 миллионов пользователей и позиционирует себя как крупнейшего вьетнамского издателя цифровой рекламы. Боты индексируют страницы для собственной поисковой выдачи — это не Googlebot и не его альтернатива, а отдельная, самостоятельная поисковая система с локальной аудиторией.
Параметры
| Параметр | Значение |
|---|---|
| Главный UA | Mozilla/5.0 (compatible; coccocbot-web/1.0; +http://help.coccoc.com/searchengine) |
| Общий токен | coccocbot/1.0 |
| Семья | coccocbot-image, coccocbot-fast, ads и другие специализированные варианты |
| Docs | help.coccoc.com — официальный раздел «Cốc Cốc Robots» |
| Верификация | reverse DNS → hostname должен оканчиваться на .coccoc.com, затем forward DNS должен вернуть исходный IP |
| robots.txt | Официально поддерживается, включая директиву crawl-delay |
Официальный пример от самой Cốc Cốc
Компания сама демонстрирует базовую настройку на своей странице документации:
# Все роботы Cốc Cốc не должны скачивать документы из '/cgi-bin'.
# Остальным роботам доступ к сайту разрешён полностью.
User-agent: *
Allow: /
User-agent: coccocbot
Disallow: /cgi-bin
Мягкая альтернатива полной блокировке: crawl-delay
Если задача не закрыть Cốc Cốc целиком, а просто снизить нагрузку, у робота есть официально поддерживаемая директива задержки между запросами — максимальное принимаемое значение 10 секунд:
User-agent: coccocbot
Crawl-delay: 10
Это даёт промежуточный вариант между «разрешить всё» и «заблокировать полностью» — полезно, если видимость во вьетнамской выдаче важна, но текущий темп обхода создаёт заметную нагрузку на origin.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Зачем coccocbot приходит на сайт
Как и любой поисковый краулер, coccocbot-web обходит сайт, чтобы построить и обновлять индекс для поисковой выдачи Cốc Cốc. Обнаружение страниц происходит стандартными способами: по ссылкам с других сайтов, через sitemap, по упоминаниям домена или через прямую отправку URL в поисковик.
- Какие зоны чаще трогает: публичный контент сайта — так же широко, как это делают Google или Яндекс
- Что ищет: контент для индексации и last-modified изменения для обновления уже проиндексированных страниц
- Чем отличается семейство: coccocbot-web индексирует HTML-страницы, coccocbot-image — отдельно обрабатывает изображения, есть и другие специализированные варианты под конкретные типы контента
Нагрузка
По сводке TrafficVeil паттерн coccocbot — порядка 10 тысяч запросов (март–июнь 2026, июнь по 14.06). Для полноценного поискового краулера, официально соблюдающего crawl-delay, такой объём — умеренный и предсказуемый фон, не аномалия.
Логи и контроль
grep -i "coccocbot" /var/log/nginx/access.log
host # ожидаем имя, оканчивающееся на .coccoc.com
User-agent: coccocbot-web
Disallow: /
if ($http_user_agent ~* "coccocbot") {
return 403;
}
Важно: изменения в robots.txt применяются не мгновенно — между правкой файла и тем, как краулер начинает её фактически учитывать, проходит время. Планируйте правки заранее, а не как экстренную реакцию.
Рекомендации
- Нужна видимость во Вьетнаме / у аудитории Cốc Cốc — Allow; для локально ориентированных проектов это реальный канал органического трафика, а не фоновый шум
- Нагрузка ощутима, но полностью терять вьетнамскую выдачу не хочется — попробуйте Crawl-delay: 10 вместо полного запрета
- Нет VN-стратегии и локальной аудитории — Disallow для всего семейства coccocbot*, критичных потерь не будет
- На позиции в Google блокировка или разрешение coccocbot не влияет — это полностью независимая поисковая система
Частые вопросы
Насколько крупный поисковик стоит за coccocbot?
Есть ли способ снизить нагрузку от coccocbot, не блокируя его полностью?
Как официально проверить, что запрос действительно от Cốc Cốc?
Сразу ли применяются изменения в robots.txt для coccocbot?
Чем coccocbot-image отличается от coccocbot-web?
Стоит ли блокировать coccocbot, если сайт не ориентирован на Вьетнам?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.