В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а CriteoBot с User-Agent вида CriteoBot/0.1 (+https://www.criteo.com/criteo-crawler/). Это не анонимный AdTech-скрипт — оператор известен и хорошо документирован: Criteo, один из крупнейших мировых игроков в контекстной и ретаргетинговой рекламе. Бот анализирует контент страниц, чтобы классифицировать их по тематике и точнее подбирать рекламу — как контекстную, так и, для участников сети Criteo, товарную ретаргетинговую.
1. Что такое CriteoBot
У CriteoBot две связанные, но разные задачи. Первая — контекстная классификация: краулер анализирует публичный контент страницы и определяет её тематические категории (например, статья про кроссовки для бега попадёт в категории «спорт» и «бег»), чтобы подбирать рекламу по смыслу страницы, а не только по поведению пользователя. Вторая — если сайт участвует в сети Criteo (например, показывает товарные объявления или ретаргетинг), бот индексирует карточки товаров и метаданные (цену, наличие, идентификаторы) для динамического ретаргетинга. Важный нюанс: сайт может получать визиты CriteoBot, даже если сам никогда не подключал Criteo напрямую — краулер заходит опортунистически, если данные о классификации страницы устарели или если про сайт узнали через партнёрскую сеть.
| Название | CriteoBot |
| User-Agent / паттерн | criteobot — официальная строка CriteoBot/0.1 (+https://www.criteo.com/criteo-crawler/) |
| Оператор | Criteo — публичная компания, один из крупнейших мировых игроков контекстной и ретаргетинговой рекламы |
| Роль | Контекстная классификация контента страниц для подбора рекламы; для участников сети Criteo — индексация товарных карточек для динамического ретаргетинга |
| Документация / ориентир | criteo.com/criteo-crawler — официальная страница с UA-строкой, ASN и списком IP, а также готовыми блоками robots.txt для allow/exclude по разделам или полностью |
| Список IP | ✅ Официально публикуется: ASN 44788, 19750, 55569 и список IP-адресов на странице criteo.com/criteo-crawler — редкий случай, когда список действительно есть и его стоит использовать |
| robots.txt | Соблюдает, включая Crawl-delay — заявленный максимум до 30 секунд, включая дробные значения |
| Пометка TrafficVeil | Нежелательный / Рекламные и AdTech-боты |
2. Зачем CriteoBot приходит на сайт
Бот запрашивает конкретный URL только тогда, когда системам Criteo нужны актуальные данные о категории контента — то есть визиты не хаотичны, а привязаны к реальной потребности в переклассификации страницы. Если сайт подключён к рекламной сети Criteo напрямую (показывает её объявления или участвует в товарном ретаргетинге), обход будет более предсказуемым и завязанным на карточки товаров и посадочные страницы.
- Какие зоны чаще трогает: посадочные страницы, /lp/, UTM-варианты URL, advertorial-страницы, а для участников сети — карточки товаров с ценой и наличием;
- Что ищет: текстовый контент для тематической классификации страницы и, где применимо, актуальные метаданные товара (цена, наличие, ID) для ретаргетинга;
- Чем отличается от браузерного пользователя: нет нормальной сессии, интервалы регулируются собственной логикой Criteo, а не поведением конкретного человека.
Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — CriteoBot. Правильная реакция — не «выключить сайт», а точечно запретить UA или ограничить его конкретными разделами через официально поддерживаемые правила robots.txt.
3. Нагрузка и риски именно для CriteoBot
Отдельной строки в публичной сводке top-bot TrafficVeil у criteobot может не быть, но в категории «Рекламные и AdTech-боты» такие агенты дают характерный фон: лишние хиты на лендинги и thank-you page, иногда обход UTM-URL. Поскольку бот заходит по мере необходимости обновить классификацию, а не по плотному расписанию, серьёзной нагрузки он обычно не создаёт — но на большом количестве уникальных посадочных с UTM-метками суммарный объём запросов может быть заметным.
Отдельный практический плюс именно для этого бота: в отличие от большинства агентов в этой энциклопедии, у CriteoBot есть официальный список ASN и IP — это даёт возможность верифицировать подлинность запроса гораздо надёжнее, чем по одной строке UA.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти CriteoBot в логах
Не ищите «просто ботов» — ищите конкретный токен criteobot и рядом смотрите соседей по семейству AdTech-краулеров.
# Базовый поиск
grep -i "criteobot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA — сверьте с официальными ASN 44788, 19750, 55569
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Отделить от похожих строк
grep -iE "criteobot|bot" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт, но здесь есть более надёжный способ: у Criteo опубликован официальный список ASN и IP-адресов на criteo.com/criteo-crawler — сверяйте запросы именно по нему, а не полагайтесь только на строку UA.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для CriteoBot
# Жёсткий запрет
User-agent: CriteoBot
Disallow: /
# Разрешить всё
User-agent: CriteoBot
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: CriteoBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
# Замедлить, не блокируя полностью (поддерживается официально, до 30 секунд)
User-agent: CriteoBot
Crawl-delay: 10
Важно: ставьте Disallow или 403 для criteobot, если не льёте рекламу через Criteo и польза от классификации вам не нужна. Официальная страница краулера предлагает готовые блоки правил под три сценария — разрешить полностью, исключить конкретные разделы или запретить полностью — их удобно скопировать напрямую без самостоятельного подбора синтаксиса.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "criteobot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=criteobot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "criteobot") {
limit_req zone=criteobot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} criteobot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите criteobot в ботах домена или в разделе /system/bots;
- Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit или Crawl-delay в robots.txt;
- Allow оставляйте, если сайт реально показывает рекламу или ретаргетинг через Criteo;
- После изменения сверьте логи по официальным ASN 44788, 19750, 55569 — так проще подтвердить, что заблокирован именно настоящий CriteoBot, а не подделка под его UA.
7. Рекомендации: что делать с CriteoBot
- Если не льёте рекламу через этого игрока — можно резать, обычно без последствий для SEO;
- Если сайт участвует в сети Criteo (реклама, товарный ретаргетинг) — оставьте Allow, иначе классификация страниц и подбор объявлений устареют;
- Если нагрузка мешает, но полностью резать не хочется — используйте официально поддерживаемый Crawl-delay вместо жёсткого запрета;
- Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
- Что вы теряете при блокировке: если не работаете с Criteo — практически ничего; если работаете — устаревшую классификацию страниц и менее точный ретаргетинг.
8. С кем не путать CriteoBot
| Бот / сосед | Кластер | UA | Комментарий |
| Amazon-Advertising-ad-standards-bot | Рекламные и AdTech-боты | amazon-advertising-ad-standards-bot | нежелательный |
| AmazonAdBot | Рекламные и AdTech-боты | amazonadbot | нежелательный |
| AudigentAdBot | Рекламные и AdTech-боты | audigentadbot | нежелательный |
| BomboraBot | Рекламные и AdTech-боты | bomborabot | нежелательный |
| BrandVerity | Рекламные и AdTech-боты | brandverity | нежелательный |
9. Стратегия allow/deny для CriteoBot
| Ситуация | Действие |
| Сайт участвует в сети Criteo (реклама, ретаргетинг) | Allow + закрыть /admin /cart /api |
| Реклама через Criteo не используется | Disallow + запрет в TrafficVeil |
| Нужен доступ, но частота обхода мешает | Crawl-delay в robots.txt (до 30 секунд) или rate-limit |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Сверять с официальными ASN 44788, 19750, 55569, не доверять только строке UA |
Частые вопросы
CriteoBot приходит только на сайты, которые сами используют Criteo?
Публикует ли Criteo официальный список IP-адресов краулера?
Зачем боту вообще нужна классификация страницы?
Можно ли просто замедлить бота, не блокируя его полностью?
Что теряет сайт, который участвует в сети Criteo, при блокировке бота?
Как надёжнее всего проверить, что это настоящий CriteoBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.