Боты5 мин чтения·11 августа 2026 г.·обновлено 8 сентября 2026 г.

Outbrain: это не AI-краулер, а служебный бот виджетов «рекомендуем к прочтению»

Вопреки шаблонной классификации «AI и LLM-краулер», outbrain — давний сервис нативной рекламы и content discovery, чей краулер индексирует страницы исключительно для работы виджетов рекомендаций у официальных партнёров-издателей. Разбираем, как устроена модель партнёрства, почему бот в принципе не рассылается без согласованной интеграции, и что означает его появление на сайте без подключённого виджета.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота outbrain: нежелательный ai и llm-краулеры

Строка outbrain в логах почти наверняка не имеет отношения к обучению AI-моделей или RAG-поиску, вопреки шаблонной классификации «AI и LLM-краулер». Outbrain — давно известный на рынке сервис нативной рекламы и content discovery: те самые блоки «рекомендуем к прочтению» или «вам может понравиться» под статьями на новостных и медийных сайтах. Краулер компании — не сборщик сырья для генеративного ИИ, а служебный компонент, без которого эти виджеты рекомендаций просто не могут работать.

Зачем сервису рекомендаций собственный краулер

По официальной технической документации Outbrain для партнёров, вся модель сервиса построена вокруг того, что каждый материал идентифицируется своим URL, а прежде чем какая-либо страница попадёт в рекомендации, её сначала нужно проиндексировать — Outbrain автоматически обходит URL, переданные через код виджета, чтобы держать индекс потенциальных рекомендаций актуальным. Помимо самого факта индексации, краулер также собирает информацию о содержимом страницы — предпочтительно через микроразметку вроде Schema.org или Open Graph, — чтобы подбирать более релевантные и интересные рекомендации для читателей конкретного сайта. Официальная классификация Cloudflare Radar формулирует это ещё короче: краулер Outbrain анализирует контент на сайтах издателей с целью показа рекламы.

Параметры бота

Параметр Значение
User-Agent / паттерн outbrain
Оператор Outbrain — сервис нативной рекламы и content discovery, партнёрская модель для издателей
Назначение Индексация страниц-кандидатов для рекомендательных виджетов + сбор данных о содержимом (микроразметка, метаданные) для релевантности рекомендаций
Модель подключения Работает только по факту официального партнёрства: новые сайты и приложения проходят согласование с Outbrain до начала разработки и запуска виджетов
IP-верификация Официальная — но не публичная: по документации партнёрской программы, конкретные IP-адреса краулера и office IP предоставляет персональный account strategist клиента, а не открытый список
Типичный размер нагрузки на страницу Сам виджет Outbrain, по документации компании, весит менее 25 КБ (8 КБ в сжатом виде) и загружается асинхронно, не блокируя загрузку страницы — но это про виджет на фронтенде, а не про сам факт обхода краулером
Список IP-адресов ❌ Публичного открытого фида не публикует — доступен только клиентам через персонального менеджера аккаунта

Почему исходная классификация вводит в заблуждение

Ключевая ошибка шаблонного описания — предположение, что раз бот индексирует контент, значит, он кормит какой-то AI-продукт. На деле логика Outbrain принципиально другая и гораздо старше генеративного ИИ: это классическая рекомендательная система для нативной рекламы, работающая на модели официального партнёрства с издателем, а не на массовом одностороннем сборе данных без ведома сайта. Более того, официальная документация прямо подчёркивает: краулинг тестовых доменов, которые ещё не должны попасть в продакшн-индекс, — это то, чего партнёры Outbrain специально избегают, передавая в тестовой среде уже боевые production-ссылки, а не URL тестового окружения, — то есть у сервиса даже есть встроенные механизмы, чтобы не индексировать лишнее.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Что это означает практически

Если на сайте нет установленного и согласованного с Outbrain виджета рекомендаций, а бот всё равно появляется в логах, это либо остаточный трафик от когда-то настроенной, но впоследствии снятой интеграции, либо повод для дополнительной проверки подлинности запроса — сама компания не рассылает краулер бесцельно по сайтам без партнёрских отношений с ними, поскольку её бизнес-модель строится именно на официально согласованном размещении виджета.

Как найти бота в логах

grep -i "outbrain" /var/log/nginx/access.log

Стоит ли блокировать

  • если сайт официально подключил виджет рекомендаций Outbrain — блокировка краулера напрямую ломает саму функцию: рекомендации перестанут обновляться и деградируют по релевантности, а свежие материалы просто не попадут в индекс для показа;
  • если сайт никогда не был партнёром Outbrain и виджет не устанавливался — прямой пользы от этого трафика нет, и блокировка обоснована;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это отдельная от классической поисковой индексации рекламная система.

Как настроить доступ

Если сайт — действующий партнёр Outbrain, для корректной работы виджетов в тестовой и боевой среде важно не просто разрешить бота в robots.txt, но и, по официальной рекомендации компании, добавить предоставленные account strategist'ом IP-адреса и точную строку User-Agent в белый список firewall — иначе виджет не сможет собрать данные и не отобразится:

User-agent: outbrain
Allow: /

Если партнёрства нет и присутствие бота нежелательно — стандартный запрет с дублированием на уровне сервера:

User-agent: outbrain
Disallow: /
if ($http_user_agent ~* "outbrain") {
    return 403;
}

Частые вопросы

outbrain собирает данные для обучения AI-моделей?
Нет, это давний сервис нативной рекламы и content discovery — краулер индексирует страницы исключительно для работы виджетов рекомендаций «вам может понравиться».
Может ли Outbrain обходить сайт без ведома его владельца?
Маловероятно — бизнес-модель компании построена на официальном партнёрстве с издателем: новые сайты проходят согласование до запуска виджетов.
Что произойдёт при блокировке бота у официального партнёра Outbrain?
Рекомендации перестанут обновляться и деградируют по релевантности, а новые материалы не попадут в индекс для показа читателям.
Есть ли у Outbrain публичный список IP-адресов?
Нет, конкретные IP предоставляет персональный account strategist клиента, а не открытый публичный фид.
Что собирает бот, помимо самого факта индексации URL?
Данные о содержимом страницы — предпочтительно через микроразметку Schema.org или Open Graph — для более релевантных рекомендаций.
Стоит ли блокировать бота, если сайт никогда не был партнёром Outbrain?
Да, прямой пользы такой трафик не приносит, и блокировка обоснована.
#outbrain#content discovery#нативная реклама#рекомендательные виджеты#бот-энциклопедия#robots.txt#verification#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil