Боты6 мин чтения·13 августа 2026 г.

CriteoBot в логах: реклама Criteo, а не случайный сборщик данных

Разбираем CriteoBot — краулер Criteo, который классифицирует контент страниц для контекстной рекламы и, для участников сети, индексирует товары под ретаргетинг. Показываем официальные ASN и IP для верификации, как найти бота в access.log и настроить allow/deny.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота CriteoBot: нежелательный рекламные и adtech-боты

В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а CriteoBot с User-Agent вида CriteoBot/0.1 (+https://www.criteo.com/criteo-crawler/). Это не анонимный AdTech-скрипт — оператор известен и хорошо документирован: Criteo, один из крупнейших мировых игроков в контекстной и ретаргетинговой рекламе. Бот анализирует контент страниц, чтобы классифицировать их по тематике и точнее подбирать рекламу — как контекстную, так и, для участников сети Criteo, товарную ретаргетинговую.

1. Что такое CriteoBot

У CriteoBot две связанные, но разные задачи. Первая — контекстная классификация: краулер анализирует публичный контент страницы и определяет её тематические категории (например, статья про кроссовки для бега попадёт в категории «спорт» и «бег»), чтобы подбирать рекламу по смыслу страницы, а не только по поведению пользователя. Вторая — если сайт участвует в сети Criteo (например, показывает товарные объявления или ретаргетинг), бот индексирует карточки товаров и метаданные (цену, наличие, идентификаторы) для динамического ретаргетинга. Важный нюанс: сайт может получать визиты CriteoBot, даже если сам никогда не подключал Criteo напрямую — краулер заходит опортунистически, если данные о классификации страницы устарели или если про сайт узнали через партнёрскую сеть.

Название CriteoBot
User-Agent / паттерн criteobot — официальная строка CriteoBot/0.1 (+https://www.criteo.com/criteo-crawler/)
Оператор Criteo — публичная компания, один из крупнейших мировых игроков контекстной и ретаргетинговой рекламы
Роль Контекстная классификация контента страниц для подбора рекламы; для участников сети Criteo — индексация товарных карточек для динамического ретаргетинга
Документация / ориентир criteo.com/criteo-crawler — официальная страница с UA-строкой, ASN и списком IP, а также готовыми блоками robots.txt для allow/exclude по разделам или полностью
Список IP ✅ Официально публикуется: ASN 44788, 19750, 55569 и список IP-адресов на странице criteo.com/criteo-crawler — редкий случай, когда список действительно есть и его стоит использовать
robots.txt Соблюдает, включая Crawl-delay — заявленный максимум до 30 секунд, включая дробные значения
Пометка TrafficVeil Нежелательный / Рекламные и AdTech-боты

2. Зачем CriteoBot приходит на сайт

Бот запрашивает конкретный URL только тогда, когда системам Criteo нужны актуальные данные о категории контента — то есть визиты не хаотичны, а привязаны к реальной потребности в переклассификации страницы. Если сайт подключён к рекламной сети Criteo напрямую (показывает её объявления или участвует в товарном ретаргетинге), обход будет более предсказуемым и завязанным на карточки товаров и посадочные страницы.

  • Какие зоны чаще трогает: посадочные страницы, /lp/, UTM-варианты URL, advertorial-страницы, а для участников сети — карточки товаров с ценой и наличием;
  • Что ищет: текстовый контент для тематической классификации страницы и, где применимо, актуальные метаданные товара (цена, наличие, ID) для ретаргетинга;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, интервалы регулируются собственной логикой Criteo, а не поведением конкретного человека.

Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — CriteoBot. Правильная реакция — не «выключить сайт», а точечно запретить UA или ограничить его конкретными разделами через официально поддерживаемые правила robots.txt.

3. Нагрузка и риски именно для CriteoBot

Отдельной строки в публичной сводке top-bot TrafficVeil у criteobot может не быть, но в категории «Рекламные и AdTech-боты» такие агенты дают характерный фон: лишние хиты на лендинги и thank-you page, иногда обход UTM-URL. Поскольку бот заходит по мере необходимости обновить классификацию, а не по плотному расписанию, серьёзной нагрузки он обычно не создаёт — но на большом количестве уникальных посадочных с UTM-метками суммарный объём запросов может быть заметным.

Отдельный практический плюс именно для этого бота: в отличие от большинства агентов в этой энциклопедии, у CriteoBot есть официальный список ASN и IP — это даёт возможность верифицировать подлинность запроса гораздо надёжнее, чем по одной строке UA.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти CriteoBot в логах

Не ищите «просто ботов» — ищите конкретный токен criteobot и рядом смотрите соседей по семейству AdTech-краулеров.

# Базовый поиск
grep -i "criteobot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — сверьте с официальными ASN 44788, 19750, 55569
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "criteobot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от похожих строк
grep -iE "criteobot|bot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт, но здесь есть более надёжный способ: у Criteo опубликован официальный список ASN и IP-адресов на criteo.com/criteo-crawler — сверяйте запросы именно по нему, а не полагайтесь только на строку UA.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для CriteoBot

# Жёсткий запрет
User-agent: CriteoBot
Disallow: /

# Разрешить всё
User-agent: CriteoBot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: CriteoBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

# Замедлить, не блокируя полностью (поддерживается официально, до 30 секунд)
User-agent: CriteoBot
Crawl-delay: 10

Важно: ставьте Disallow или 403 для criteobot, если не льёте рекламу через Criteo и польза от классификации вам не нужна. Официальная страница краулера предлагает готовые блоки правил под три сценария — разрешить полностью, исключить конкретные разделы или запретить полностью — их удобно скопировать напрямую без самостоятельного подбора синтаксиса.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "criteobot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=criteobot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "criteobot") {
        limit_req zone=criteobot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} criteobot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите criteobot в ботах домена или в разделе /system/bots;
  • Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit или Crawl-delay в robots.txt;
  • Allow оставляйте, если сайт реально показывает рекламу или ретаргетинг через Criteo;
  • После изменения сверьте логи по официальным ASN 44788, 19750, 55569 — так проще подтвердить, что заблокирован именно настоящий CriteoBot, а не подделка под его UA.

7. Рекомендации: что делать с CriteoBot

  • Если не льёте рекламу через этого игрока — можно резать, обычно без последствий для SEO;
  • Если сайт участвует в сети Criteo (реклама, товарный ретаргетинг) — оставьте Allow, иначе классификация страниц и подбор объявлений устареют;
  • Если нагрузка мешает, но полностью резать не хочется — используйте официально поддерживаемый Crawl-delay вместо жёсткого запрета;
  • Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
  • Что вы теряете при блокировке: если не работаете с Criteo — практически ничего; если работаете — устаревшую классификацию страниц и менее точный ретаргетинг.

8. С кем не путать CriteoBot

Бот / сосед Кластер UA Комментарий
Amazon-Advertising-ad-standards-bot Рекламные и AdTech-боты amazon-advertising-ad-standards-bot нежелательный
AmazonAdBot Рекламные и AdTech-боты amazonadbot нежелательный
AudigentAdBot Рекламные и AdTech-боты audigentadbot нежелательный
BomboraBot Рекламные и AdTech-боты bomborabot нежелательный
BrandVerity Рекламные и AdTech-боты brandverity нежелательный

9. Стратегия allow/deny для CriteoBot

Ситуация Действие
Сайт участвует в сети Criteo (реклама, ретаргетинг) Allow + закрыть /admin /cart /api
Реклама через Criteo не используется Disallow + запрет в TrafficVeil
Нужен доступ, но частота обхода мешает Crawl-delay в robots.txt (до 30 секунд) или rate-limit
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Сверять с официальными ASN 44788, 19750, 55569, не доверять только строке UA

Частые вопросы

CriteoBot приходит только на сайты, которые сами используют Criteo?
Нет, бот может заходить опортунистически даже без прямого подключения — например, если данные о классификации страницы устарели или про сайт узнали через партнёрскую сеть.
Публикует ли Criteo официальный список IP-адресов краулера?
Да, и это редкий случай для такой энциклопедии — на официальной странице criteo.com/criteo-crawler указаны конкретные ASN (44788, 19750, 55569) и список IP.
Зачем боту вообще нужна классификация страницы?
Чтобы подбирать контекстную рекламу по смыслу контента, а не только по поведению пользователя — например, страницу про кроссовки для бега бот отнесёт к категориям «спорт» и «бег».
Можно ли просто замедлить бота, не блокируя его полностью?
Да, Criteo официально поддерживает директиву Crawl-delay в robots.txt со значением до 30 секунд, включая дробные.
Что теряет сайт, который участвует в сети Criteo, при блокировке бота?
Актуальность классификации страниц и точность товарного ретаргетинга — объявления начнут подбираться по устаревшим данным.
Как надёжнее всего проверить, что это настоящий CriteoBot?
Сверить IP запроса с официально опубликованными ASN 44788, 19750 и 55569, а не полагаться только на совпадение строки User-Agent.
#CriteoBot#Criteo#AdTech#ретаргетинг#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil