Боты5 мин чтения·12 августа 2026 г.

Taboolabot: если заблокировать по слову "bot" в общем правиле, собственная реклама может тихо перестать работать

Официальное имя краулера крупнейшей в мире платформы контент-дискавери — Taboolabot, а не просто «Taboola», и он обходит только те посадочные страницы, которые сам рекламодатель добавил в кампанию. Разбираем, почему сама Taboola предупреждает о риске случайной блокировки через общие правила против слова «bot», и отдельный, не связанный с этим краулером механизм, из-за которого Google физически не видит рекомендательные виджеты Taboola на сайтах-издателях.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Taboola: нежелательный рекламные и adtech-боты

Taboola — крупнейшая в мире платформа контент-дискавери: свыше 1,4 миллиарда пользователей ежемесячно, более 20 000 компаний-клиентов и партнёрство с изданиями уровня CNBC, NBC News, USA Today и Business Insider. Официальное имя её краулера в строке User-Agent — не просто «Taboola», а Taboolabot, и назначение у него предельно конкретное: это не общий сбор контента, а сервисная проверка сайтов рекламодателей, которые уже разместили кампанию через платформу.

Зачем рекламной платформе краулер, который заходит на чужие сайты

По официальной справке Taboola для рекламодателей, логика простая: как только рекламодатель добавляет URL своей посадочной страницы в кампанию, краулер Taboola обходит эту страницу, чтобы разобрать её содержимое, а также забрать заголовок и превью-изображение из метаданных сайта для формирования рекламного объявления. Официальная документация прямо предупреждает: если краулер не может успешно обойти страницу, кампания рекламодателя просто не запустится — то есть бот здесь технически необходим не постороннему наблюдателю, а самому рекламодателю, который платит за размещение через Taboola. Компания отдельно подчёркивает: сайты, которые блокируют по умолчанию всё, что содержит слово «bot» в UA, могут случайно заблокировать и Taboolabot — и рекомендует явно внести его в белый список именно по этой причине.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 (compatible; Taboolabot/3.7; +http://www.taboola.com)
Оператор Taboola
Официальная документация help.taboola.com — раздел «The Taboola Crawler»
Назначение Обход посадочных страниц, добавленных рекламодателями в кампании: разбор контента, извлечение заголовка и превью-изображения для формирования объявления
Условие срабатывания Только по факту того, что кто-то (рекламодатель или его агентство) добавил конкретный URL в кампанию Taboola — не системный обход произвольных сайтов
Поведение при неудаче При первой неудачной попытке обхода бот повторяет запрос ещё несколько раз, прежде чем кампания будет признана нерабочей
Требование к содержимому страницы Контент, который видит краулер, должен полностью совпадать с тем, что видит реальный пользователь при переходе на посадочную страницу — расхождение (например, из-за клоакинга) тоже мешает запуску кампании
Список IP-адресов ❌ Отдельного официального фида не найдено

Отдельно: почему Taboola не влияет на позиции сайта в Google

Полезная деталь, прямо разъяснённая в справке компании для издателей: сами рекомендательные блоки Taboola, размещаемые на сайтах-партнёрах (та самая лента «интересное по теме» под статьями), выполнены client-side и намеренно закрыты через собственный robots.txt на промежуточном поддомене — именно так, как рекомендует Google в правилах для маркированного рекламного контента. Это значит, что Googlebot физически не может обойти и передать вес ссылкам в самих рекомендательных блоках Taboola, установленных на сайте-издателе. Но это отдельный, не связанный с Taboolabot механизм — сам краулер, о котором эта статья, при этом продолжает штатно обходить посадочные страницы рекламодателей независимо от этой настройки.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Почему исходная классификация «нежелательный» требует уточнения

Ключевое отличие Taboolabot от произвольного стороннего AdTech-скрапера — прямая договорная связь между ботом и стороной, разместившей ссылку на посадочную страницу. Если владелец сайта сам является рекламодателем Taboola и продвигает свою же страницу через платформу — бот действует строго в его интересах, и блокировка напрямую ломает собственную рекламную кампанию. Если же сайт оказался объектом обхода, будучи посадочной страницей чужой кампании (например, партнёрской или агентской), присутствие бота — не угроза безопасности, а техническая необходимость для запуска чужой, но легитимной рекламной активности, которая всё равно связана с этим URL.

Сколько трафика он создаёт

Учитывая, что обход происходит только по факту добавления конкретного URL в конкретную кампанию, а не системно, объём запросов на отдельном сайте обычно точечный и привязан к моменту запуска или обновления кампаний, ссылающихся именно на этот домен.

Как найти бота в логах

grep -i "Taboolabot" /var/log/nginx/access.log

# Точечные обращения к конкретным посадочным
grep -i "Taboolabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Стоит ли блокировать

  • если сайт (или связанная с ним сторона) продвигает страницы через Taboola — бота нужно явно разрешить, иначе рекламная кампания не запустится вовсе;
  • если сайт не связан с рекламой через Taboola, а присутствие бота нежелательно — блокировка не несёт последствий для органической выдачи;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие Taboolabot не влияет напрямую — сама компания отдельно и намеренно закрывает свои рекомендательные виджеты от Googlebot собственным robots.txt на промежуточном домене, независимо от поведения на сайте-издателе.

Как настроить доступ

Явное разрешение, важное для тех, кто размещает рекламу через платформу:

User-agent: Taboolabot
Allow: /

Стандартный запрет с дублированием на уровне сервера, если присутствие бота нежелательно:

User-agent: Taboolabot
Disallow: /
if ($http_user_agent ~* "Taboolabot") {
    return 403;
}

Важно: если сайт использует общее широкое правило блокировки любого UA, содержащего слово «bot», стоит явно исключить из него Taboolabot отдельной строкой — иначе собственная рекламная кампания через платформу перестанет запускаться незаметно для владельца сайта.

Частые вопросы

Как правильно называется бот Taboola в логах?
Taboolabot — это официальное имя в строке User-Agent, а не просто «Taboola».
Зачем боту заходить на посадочные страницы?
Чтобы разобрать содержимое и извлечь заголовок с превью-изображением для формирования рекламного объявления — это требуется для запуска кампании рекламодателя, добавившего этот URL.
Что будет, если краулер не сможет обойти страницу?
После нескольких неудачных попыток кампания рекламодателя не запустится вовсе — бот здесь технически необходим самому рекламодателю.
Почему компания предупреждает об общих правилах блокировки по слову "bot"?
Потому что такие широкие правила могут случайно заблокировать и Taboolabot, из-за чего собственная рекламная кампания через платформу тихо перестанет работать.
Влияет ли Taboolabot на позиции сайта в Google?
Нет напрямую — но сами рекомендательные виджеты Taboola на сайтах-издателях отдельно и намеренно закрыты от Googlebot собственным robots.txt на промежуточном домене, независимо от поведения этого краулера.
Стоит ли блокировать бота, если сайт не размещает рекламу через Taboola?
Да, в этом случае блокировка не несёт последствий для органической выдачи или иных функций сайта.
#taboola#taboolabot#content discovery#ad-verification#бот-энциклопедия#robots.txt#рекламные кампании#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil