TrafficVeil
Боты 7 мин13 августа 2026 г.

Taboolabot в логах: аудит вашей же рекламной кампании

Разбираем Taboolabot — официальный краулер Taboola, который проверяет посадочные страницы рекламодателей на клоакинг перед запуском кампании нативной рекламы. Показываем, почему блокировка может остановить активную рекламу, и как найти бота в access.log.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое Taboolabot
  2. 2. Зачем Taboolabot приходит на сайт
  3. 3. Нагрузка и риски именно для Taboolabot
  4. 4. Как найти Taboolabot в логах
  5. 5. robots.txt для Taboolabot
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с Taboolabot
  8. 8. С кем не путать Taboolabot
  9. 9. Стратегия allow/deny для Taboolabot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Если фильтровать access.log по taboolabot, часто всплывает целый пласт машинных хитов — это и есть Taboolabot. Оператор здесь известен и хорошо документирован: Taboola, один из крупнейших мировых игроков в нативной рекламе (контентные рекомендации в духе «Вам может понравиться» на новостных и медиасайтах). Официальный справочный центр Taboola для рекламодателей прямо описывает назначение этого краулера — и оно конкретнее, чем общая формулировка «brand safety / ad-verification».

1. Что такое Taboolabot

По официальной статье «The Taboola Crawler» в справочном центре Taboola, бот посещает посадочные страницы именно рекламодателей — то есть тех, кто запускает через Taboola собственные кампании нативной рекламы и указывает эту страницу как целевую. Задача краулера — проверить, что контент, который он получает при заходе на страницу, совпадает с тем, что увидит реальный посетитель по клику на рекламу. Это требование против клоакинга: если содержимое для бота и для живого пользователя расходится, Taboola прямо предупреждает — «наша система не сможет запустить вашу кампанию». Официальная рекомендация для рекламодателей — внести краулер в allowlist, если планируется реклама через Taboola.

Название Taboolabot
User-Agent / паттерн taboolabot — официальная строка Mozilla/5.0 (compatible; Taboolabot/3.7; +http://www.taboola.com)
Оператор Taboola — крупная платформа нативной рекламы и рекомендаций контента
Роль Аудит посадочных страниц рекламодателей Taboola: проверка, что контент для бота совпадает с тем, что видит реальный пользователь (защита от клоакинга), плюс сбор метаданных страницы для кампании
Документация / ориентир help.taboola.com — официальная статья «The Taboola Crawler» с UA-строкой и инструкцией по whitelisting для рекламодателей
Список IP ❌ Официального списка IP не найдено — для верификации используйте связку UA + поведение
robots.txt Учитывается — сама Taboola в документации приводит стандартное правило User-agent: Taboolabot / Disallow: / как пример блокировки для тех, кто не хочет пускать бота
Пометка TrafficVeil Нежелательный / Рекламные и AdTech-боты

2. Зачем Taboolabot приходит на сайт

Ключевой практический вопрос — не «зачем Taboola в целом собирает данные», а «кто именно на этом домене запустил кампанию через Taboola». Если сайт (или кто-то, кто закупает трафик на него — сам владелец, партнёр, медиабайер) ведёт нативную рекламу через Taboola и указывает страницы этого домена как посадочные, визиты бота — ожидаемая и необходимая часть работы кампании: без успешного аудита кампания просто не запустится или остановится.

  • Какие зоны чаще трогает: посадочные, /lp/, UTM-варианты URL, advertorial-страницы — именно те, что указаны как целевые в кампаниях Taboola;
  • Что ищет: совпадение контента для бота и для живого пользователя (анти-клоакинг), а также метаданные страницы для кампании;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, обращения привязаны к циклу аудита конкретной рекламной кампании, а не к произвольному расписанию.

Типичный кейс: CDN-трафик дорожает, origin CPU пилит HTML. Фильтр по taboolabot показывает обращения на лендинги и UTM-URL — прежде чем блокировать, стоит уточнить у команды, не льётся ли сейчас трафик именно через Taboola на эти страницы: если да, блокировка бота может остановить саму рекламную кампанию.

3. Нагрузка и риски именно для Taboolabot

Отдельной строки в публичной сводке top-bot TrafficVeil у taboolabot может не быть, но в категории «Рекламные и AdTech-боты» такие агенты дают характерный фон: лишние хиты на лендинги и thank-you page, иногда обход UTM-URL. Практический риск здесь специфический и обратный привычному: если сайт реально рекламируется через Taboola, слепая блокировка бота не «экономит ресурсы», а рискует остановить активную и, возможно, платную рекламную кампанию — цена ошибки здесь выше среднего для категории.

4. Как найти Taboolabot в логах

Не ищите «просто ботов» — ищите конкретный токен taboolabot и в первую очередь проверьте, не соответствуют ли посещаемые URL текущим или недавним кампаниям Taboola.

# Базовый поиск
grep -i "taboolabot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот — сверьте с активными посадочными страницами кампаний
grep -i "taboolabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "taboolabot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "taboolabot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отделить от похожих строк
grep -iE "taboolabot|bot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP Taboola не публикует, поэтому для решения allow/deny смотрите связку: UA + частоту + совпадение посещаемых URL с реальными посадочными страницами рекламных кампаний — это самый надёжный практический сигнал именно для этого бота.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Taboolabot

# Жёсткий запрет — по образцу самой Taboola в их официальной документации
User-agent: Taboolabot
Disallow: /

# Разрешить всё — обязательно, если сайт рекламируется через Taboola
User-agent: Taboolabot
Allow: /

Важно: если сайт ведёт рекламу через Taboola, официальная инструкция компании прямо рекомендует внести краулер в allowlist — иначе кампания не запустится из-за невозможности пройти аудит контента. Если рекламы через Taboola на сайте нет, стандартное Disallow из официальной документации — рабочий и предсказуемый вариант.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "taboolabot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=taboolabot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "taboolabot") {
        limit_req zone=taboolabot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} taboolabot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите taboolabot в ботах домена или в /system/bots;
  • Перед блокировкой обязательно уточните у медиабаинг-команды, не запущена ли сейчас или недавно кампания через Taboola на посещаемые ботом URL;
  • Если реклама не ведётся — категория «запретить»; если ведётся — Allow без ограничений;
  • После изменения сверьте логи и, отдельно, статус активных кампаний в кабинете Taboola — блокировка не должна была их остановить.

7. Рекомендации: что делать с Taboolabot

  • Если не льёте рекламу через Taboola — можно резать по стандартному правилу из их же документации;
  • Если льёте — обязательно оставьте Allow, иначе кампания не пройдёт аудит и не запустится или остановится;
  • Прежде чем менять правила, сверьтесь с медиабаинг-командой или партнёрами, закупающими трафик — присутствие бота может быть их активностью, а не вашей;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: если рекламы через Taboola нет — ничего не теряете; если есть — рискуете остановить активную, возможно платную рекламную кампанию.

8. С кем не путать Taboolabot

Бот / сосед Кластер UA Комментарий
Amazon-Advertising-ad-standards-bot Рекламные и AdTech-боты amazon-advertising-ad-standards-bot нежелательный, другой оператор
AmazonAdBot Рекламные и AdTech-боты amazonadbot нежелательный
AudigentAdBot Рекламные и AdTech-боты audigentadbot нежелательный
BomboraBot Рекламные и AdTech-боты bomborabot нежелательный
BrandVerity Рекламные и AdTech-боты brandverity нежелательный

9. Стратегия allow/deny для Taboolabot

Ситуация Действие
Сайт (или партнёр/медиабайер) ведёт рекламу через Taboola Allow без ограничений — иначе кампания не запустится
Реклама через Taboola не используется Disallow + запрет в TrafficVeil, по образцу официальной документации
Неясно, чья это кампания на конкретном URL Уточнить у медиабаинг-команды/партнёров перед блокировкой
Нежелательный по базе TrafficVeil Не применять без проверки активных кампаний — риск остановить рекламу выше обычного
Подозрение на spoofing UA Официальных IP нет — сверять совпадение посещаемых URL с реальными посадочными кампаний, не доверять только UA

Частые вопросы

Taboolabot — это сторонний аналитический краулер?

Нет, по официальной документации Taboola это бот, который проверяет посадочные страницы именно рекламодателей, запустивших кампанию через саму платформу.

Что именно проверяет бот на странице?

Совпадает ли контент, который видит краулер, с тем, что увидит реальный пользователь по клику на рекламу — это защита от клоакинга, требование для запуска кампании.

Что будет, если не пропустить бота на сайт с активной кампанией?

По официальному заявлению Taboola, кампания просто не сможет запуститься — компания прямо рекомендует вносить краулер в allowlist в этом случае.

Как понять, чья это рекламная кампания, если я не занимаюсь медиабаингом лично?

Стоит уточнить у партнёров или медиабаинг-команды, закупающей трафик на конкретные посадочные страницы — присутствие бота может быть их активностью.

Публикует ли Taboola официальный список IP краулера?

Нет, официального списка не найдено — для верификации лучше сверять совпадение посещаемых URL с реальными посадочными страницами кампаний.

Что если рекламы через Taboola на сайте точно нет?

Тогда можно спокойно использовать стандартное правило Disallow, которое сама Taboola приводит в своей официальной документации.

#Taboolabot#Taboola#нативная реклама#анти-клоакинг#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.