Taboola — крупнейшая в мире платформа контент-дискавери: свыше 1,4 миллиарда пользователей ежемесячно, более 20 000 компаний-клиентов и партнёрство с изданиями уровня CNBC, NBC News, USA Today и Business Insider. Официальное имя её краулера в строке User-Agent — не просто «Taboola», а Taboolabot, и назначение у него предельно конкретное: это не общий сбор контента, а сервисная проверка сайтов рекламодателей, которые уже разместили кампанию через платформу.
Зачем рекламной платформе краулер, который заходит на чужие сайты
По официальной справке Taboola для рекламодателей, логика простая: как только рекламодатель добавляет URL своей посадочной страницы в кампанию, краулер Taboola обходит эту страницу, чтобы разобрать её содержимое, а также забрать заголовок и превью-изображение из метаданных сайта для формирования рекламного объявления. Официальная документация прямо предупреждает: если краулер не может успешно обойти страницу, кампания рекламодателя просто не запустится — то есть бот здесь технически необходим не постороннему наблюдателю, а самому рекламодателю, который платит за размещение через Taboola. Компания отдельно подчёркивает: сайты, которые блокируют по умолчанию всё, что содержит слово «bot» в UA, могут случайно заблокировать и Taboolabot — и рекомендует явно внести его в белый список именно по этой причине.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; Taboolabot/3.7; +http://www.taboola.com) |
| Оператор | Taboola |
| Официальная документация | help.taboola.com — раздел «The Taboola Crawler» |
| Назначение | Обход посадочных страниц, добавленных рекламодателями в кампании: разбор контента, извлечение заголовка и превью-изображения для формирования объявления |
| Условие срабатывания | Только по факту того, что кто-то (рекламодатель или его агентство) добавил конкретный URL в кампанию Taboola — не системный обход произвольных сайтов |
| Поведение при неудаче | При первой неудачной попытке обхода бот повторяет запрос ещё несколько раз, прежде чем кампания будет признана нерабочей |
| Требование к содержимому страницы | Контент, который видит краулер, должен полностью совпадать с тем, что видит реальный пользователь при переходе на посадочную страницу — расхождение (например, из-за клоакинга) тоже мешает запуску кампании |
| Список IP-адресов | ❌ Отдельного официального фида не найдено |
Отдельно: почему Taboola не влияет на позиции сайта в Google
Полезная деталь, прямо разъяснённая в справке компании для издателей: сами рекомендательные блоки Taboola, размещаемые на сайтах-партнёрах (та самая лента «интересное по теме» под статьями), выполнены client-side и намеренно закрыты через собственный robots.txt на промежуточном поддомене — именно так, как рекомендует Google в правилах для маркированного рекламного контента. Это значит, что Googlebot физически не может обойти и передать вес ссылкам в самих рекомендательных блоках Taboola, установленных на сайте-издателе. Но это отдельный, не связанный с Taboolabot механизм — сам краулер, о котором эта статья, при этом продолжает штатно обходить посадочные страницы рекламодателей независимо от этой настройки.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Почему исходная классификация «нежелательный» требует уточнения
Ключевое отличие Taboolabot от произвольного стороннего AdTech-скрапера — прямая договорная связь между ботом и стороной, разместившей ссылку на посадочную страницу. Если владелец сайта сам является рекламодателем Taboola и продвигает свою же страницу через платформу — бот действует строго в его интересах, и блокировка напрямую ломает собственную рекламную кампанию. Если же сайт оказался объектом обхода, будучи посадочной страницей чужой кампании (например, партнёрской или агентской), присутствие бота — не угроза безопасности, а техническая необходимость для запуска чужой, но легитимной рекламной активности, которая всё равно связана с этим URL.
Сколько трафика он создаёт
Учитывая, что обход происходит только по факту добавления конкретного URL в конкретную кампанию, а не системно, объём запросов на отдельном сайте обычно точечный и привязан к моменту запуска или обновления кампаний, ссылающихся именно на этот домен.
Как найти бота в логах
grep -i "Taboolabot" /var/log/nginx/access.log
# Точечные обращения к конкретным посадочным
grep -i "Taboolabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Стоит ли блокировать
- если сайт (или связанная с ним сторона) продвигает страницы через Taboola — бота нужно явно разрешить, иначе рекламная кампания не запустится вовсе;
- если сайт не связан с рекламой через Taboola, а присутствие бота нежелательно — блокировка не несёт последствий для органической выдачи;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие Taboolabot не влияет напрямую — сама компания отдельно и намеренно закрывает свои рекомендательные виджеты от Googlebot собственным robots.txt на промежуточном домене, независимо от поведения на сайте-издателе.
Как настроить доступ
Явное разрешение, важное для тех, кто размещает рекламу через платформу:
User-agent: Taboolabot
Allow: /
Стандартный запрет с дублированием на уровне сервера, если присутствие бота нежелательно:
User-agent: Taboolabot
Disallow: /
if ($http_user_agent ~* "Taboolabot") {
return 403;
}
Важно: если сайт использует общее широкое правило блокировки любого UA, содержащего слово «bot», стоит явно исключить из него Taboolabot отдельной строкой — иначе собственная рекламная кампания через платформу перестанет запускаться незаметно для владельца сайта.
Частые вопросы
Как правильно называется бот Taboola в логах?
Зачем боту заходить на посадочные страницы?
Что будет, если краулер не сможет обойти страницу?
Почему компания предупреждает об общих правилах блокировки по слову "bot"?
Влияет ли Taboolabot на позиции сайта в Google?
Стоит ли блокировать бота, если сайт не размещает рекламу через Taboola?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.