Строка outbrain в логах почти наверняка не имеет отношения к обучению AI-моделей или RAG-поиску, вопреки шаблонной классификации «AI и LLM-краулер». Outbrain — давно известный на рынке сервис нативной рекламы и content discovery: те самые блоки «рекомендуем к прочтению» или «вам может понравиться» под статьями на новостных и медийных сайтах. Краулер компании — не сборщик сырья для генеративного ИИ, а служебный компонент, без которого эти виджеты рекомендаций просто не могут работать.
Зачем сервису рекомендаций собственный краулер
По официальной технической документации Outbrain для партнёров, вся модель сервиса построена вокруг того, что каждый материал идентифицируется своим URL, а прежде чем какая-либо страница попадёт в рекомендации, её сначала нужно проиндексировать — Outbrain автоматически обходит URL, переданные через код виджета, чтобы держать индекс потенциальных рекомендаций актуальным. Помимо самого факта индексации, краулер также собирает информацию о содержимом страницы — предпочтительно через микроразметку вроде Schema.org или Open Graph, — чтобы подбирать более релевантные и интересные рекомендации для читателей конкретного сайта. Официальная классификация Cloudflare Radar формулирует это ещё короче: краулер Outbrain анализирует контент на сайтах издателей с целью показа рекламы.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | outbrain |
| Оператор | Outbrain — сервис нативной рекламы и content discovery, партнёрская модель для издателей |
| Назначение | Индексация страниц-кандидатов для рекомендательных виджетов + сбор данных о содержимом (микроразметка, метаданные) для релевантности рекомендаций |
| Модель подключения | Работает только по факту официального партнёрства: новые сайты и приложения проходят согласование с Outbrain до начала разработки и запуска виджетов |
| IP-верификация | Официальная — но не публичная: по документации партнёрской программы, конкретные IP-адреса краулера и office IP предоставляет персональный account strategist клиента, а не открытый список |
| Типичный размер нагрузки на страницу | Сам виджет Outbrain, по документации компании, весит менее 25 КБ (8 КБ в сжатом виде) и загружается асинхронно, не блокируя загрузку страницы — но это про виджет на фронтенде, а не про сам факт обхода краулером |
| Список IP-адресов | ❌ Публичного открытого фида не публикует — доступен только клиентам через персонального менеджера аккаунта |
Почему исходная классификация вводит в заблуждение
Ключевая ошибка шаблонного описания — предположение, что раз бот индексирует контент, значит, он кормит какой-то AI-продукт. На деле логика Outbrain принципиально другая и гораздо старше генеративного ИИ: это классическая рекомендательная система для нативной рекламы, работающая на модели официального партнёрства с издателем, а не на массовом одностороннем сборе данных без ведома сайта. Более того, официальная документация прямо подчёркивает: краулинг тестовых доменов, которые ещё не должны попасть в продакшн-индекс, — это то, чего партнёры Outbrain специально избегают, передавая в тестовой среде уже боевые production-ссылки, а не URL тестового окружения, — то есть у сервиса даже есть встроенные механизмы, чтобы не индексировать лишнее.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Что это означает практически
Если на сайте нет установленного и согласованного с Outbrain виджета рекомендаций, а бот всё равно появляется в логах, это либо остаточный трафик от когда-то настроенной, но впоследствии снятой интеграции, либо повод для дополнительной проверки подлинности запроса — сама компания не рассылает краулер бесцельно по сайтам без партнёрских отношений с ними, поскольку её бизнес-модель строится именно на официально согласованном размещении виджета.
Как найти бота в логах
grep -i "outbrain" /var/log/nginx/access.log
Стоит ли блокировать
- если сайт официально подключил виджет рекомендаций Outbrain — блокировка краулера напрямую ломает саму функцию: рекомендации перестанут обновляться и деградируют по релевантности, а свежие материалы просто не попадут в индекс для показа;
- если сайт никогда не был партнёром Outbrain и виджет не устанавливался — прямой пользы от этого трафика нет, и блокировка обоснована;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это отдельная от классической поисковой индексации рекламная система.
Как настроить доступ
Если сайт — действующий партнёр Outbrain, для корректной работы виджетов в тестовой и боевой среде важно не просто разрешить бота в robots.txt, но и, по официальной рекомендации компании, добавить предоставленные account strategist'ом IP-адреса и точную строку User-Agent в белый список firewall — иначе виджет не сможет собрать данные и не отобразится:
User-agent: outbrain
Allow: /
Если партнёрства нет и присутствие бота нежелательно — стандартный запрет с дублированием на уровне сервера:
User-agent: outbrain
Disallow: /
if ($http_user_agent ~* "outbrain") {
return 403;
}Частые вопросы
outbrain собирает данные для обучения AI-моделей?
Может ли Outbrain обходить сайт без ведома его владельца?
Что произойдёт при блокировке бота у официального партнёра Outbrain?
Есть ли у Outbrain публичный список IP-адресов?
Что собирает бот, помимо самого факта индексации URL?
Стоит ли блокировать бота, если сайт никогда не был партнёром Outbrain?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.