TrafficVeil
Боты 6 мин21 августа 2026 г.

BublupBot: редкий случай полной прозрачности от оператора

В отличие от большинства ботов в этой категории, у BublupBot есть официальная страница с описанием, точным User-Agent и задокументированной DNS-верификацией от самого Bublup. Разбираемся, зачем сервис визуальной организации контента заходит на сторонние сайты, почему у него уже встроен rate-limiting, и как через официальный канал вообще исключить сайт из посещений вместо технической блокировки.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое BublupBot на самом деле
  2. 2. Зачем BublupBot приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти BublupBot в логах
  5. 5. robots.txt для BublupBot
  6. 6. Блокировка вручную, через TrafficVeil — и официальный канал
  7. 7. Что делать: короткий алгоритм
  8. 8. Открытый вопрос по категоризации
  9. 9. Стратегия allow/deny для BublupBot
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В отличие от большинства записей в категории «Прочие краулеры и сервисы», у BublupBot есть редкая роскошь — официальная страница с открытым описанием, точным User-Agent и даже инструкцией по верификации через DNS. Это бот сервиса Bublup (bublup.com), визуального инструмента для сохранения и организации ссылок, файлов и заметок. У большинства ботов в этой энциклопедии такой прозрачности нет — стоит этим воспользоваться.

1. Что такое BublupBot на самом деле

Bublup — облачный сервис для визуальной организации контента: пользователи сохраняют ссылки, файлы, изображения и заметки в персональные коллекции, делятся ими и создают из них лендинги. По официальному описанию самого Bublup, BublupBot систематически обходит интересный контент в интернете, формируя базу из миллионов элементов для движка рекомендаций сервиса — он подсказывает пользователям похожий контент и трендовые темы на основе того, что они сохраняют.

Функционально бот извлекает с посещённых страниц заголовок, описание и связанные изображения — это нужно, чтобы красиво отображать сохранённые ссылки, фильтровать спам и периодически обновлять уже сохранённый пользователями контент. То есть визит объясняется двумя механизмами сразу: широким обходом для наполнения базы рекомендаций и точечным обновлением уже сохранённых конкретными пользователями страниц.

Параметр Значение
Название BublupBot
Оператор Bublup, Inc. — официально подтверждённый оператор, bublup.com
Роль Систематический обход контента для базы рекомендаций сервиса + обновление данных по уже сохранённым пользователями страницам (заголовок, описание, изображения)
User-Agent / паттерн BublupBot (+https://www.bublup.com/bublup-bot.html) Mozilla/5.0 (compatible; BublupBot; https://www.bublup.com/bublup-bot.html)
Верификация Официально задокументирована: обратный DNS IP должен резолвиться в домен, заканчивающийся на bublup.com, затем прямой DNS этого имени должен вернуть тот же IP
Rate-limiting Настроен по умолчанию самим Bublup — бот сам ограничивает частоту параллельных запросов к одному сайту
Диапазон IP Не фиксирован — инфраструктура масштабируется динамически, IP могут меняться без предупреждения; жёстко прописывать конкретные адреса не рекомендуется самим оператором
Официальный opt-out Да — можно написать на info@bublup.com и попасть в список «do not visit», после чего бот перестанет посещать сайт вовсе
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы — при этом уровень прозрачности заметно выше типичного для этой категории (см. раздел 8)

2. Зачем BublupBot приходит на сайт

  • наполнение общей базы рекомендаций Bublup — систематический обход контента, который потенциально может быть интересен пользователям сервиса;
  • обновление данных по странице, которую конкретный пользователь Bublup уже сохранил в свою коллекцию — заголовок, описание, превью-изображение могли устареть с момента сохранения;
  • фильтрация спама — часть логики бота работает на отсев некачественного контента при построении рекомендаций.

Типичный кейс: в логах регулярно фиксируется BublupBot на разных, не всегда связанных между собой страницах сайта — это ожидаемо, поскольку бот не привязан только к разово сохранённым пользователями URL, а ведёт и более широкий систематический обход для базы рекомендаций.

3. Нагрузка и риски

Формально нагрузка ожидается умеренной — сам Bublup заявляет встроенный rate-limiting параллельных запросов к одному сайту. На практике это выгодно отличает BublupBot от многих других записей в категории «Прочие краулеры и сервисы», где о самоограничении частоты запросов ничего не известно.

Прямой пользы для владельца сайта, как правило, нет — данные уходят в рекомендательную базу Bublup, а не возвращаются в виде трафика или атрибуции. Основной практический риск для большинства сайтов — фоновый шум в аналитике и небольшой дополнительный расход ресурсов, а не что-то более серьёзное: описанная функция бота (извлечение title/description/изображений) технически близка к тому, что делают легитимные fetcher-ы превью-ссылок.

4. Как найти BublupBot в логах

# Базовый поиск
grep -i "bublupbot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "bublupbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — помните, что диапазон у Bublup не фиксирован
grep -i "bublupbot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "bublupbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация. Здесь, в отличие от большинства других записей энциклопедии, есть официальная, задокументированная самим оператором процедура:

# Шаг 1: обратный DNS по IP из лога
dig +short -x "$IP"
# Ожидаемый результат: имя хоста, заканчивающееся на bublup.com

# Шаг 2: прямой DNS по полученному имени
dig +short "hostname.bublup.com"
# Ожидаемый результат: тот же самый IP, что и в шаге 1

Если трафик с валидным Bublup User-Agent не проходит эту проверку — по рекомендации самого оператора стоит написать на info@bublup.com, а не сразу считать это подделкой UA.

5. robots.txt для BublupBot

# Жёсткий запрет
User-agent: BublupBot
Disallow: /

# Разрешить всё
User-agent: BublupBot
Allow: /

# Компромисс: закрыть личный кабинет и служебные разделы, оставить публичку
User-agent: BublupBot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

6. Блокировка вручную, через TrafficVeil — и официальный канал

Nginx:

if ($http_user_agent ~* "bublupbot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=bublupbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "bublupbot") {
        limit_req zone=bublupbot burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} bublupbot [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите bublupbot в разделе ботов домена или в /system/bots;
  • для нежелательного сценария — категория «запретить», технически это надёжно закроет доступ;
  • но здесь есть более чистый вариант, недоступный для большинства других записей: написать на info@bublup.com с просьбой добавить домен в список «do not visit» — это официальный канал, а не только техническая блокировка;
  • после изменения сверьте логи: хиты BublupBot должны уйти в блок/лимит (или прекратиться вовсе при использовании официального opt-out).

7. Что делать: короткий алгоритм

  • Пользы нет и трафик раздражает — самый чистый вариант здесь: написать в Bublup напрямую и попросить добавить сайт в «do not visit», а не только настраивать техническую блокировку;
  • Хотите технической блокировки быстро, не дожидаясь ответа оператора — Disallow/403 стандартным способом;
  • Нагрузка минимальна благодаря встроенному rate-limiting самого бота — для многих сайтов можно вообще не трогать;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно;
  • Не полагайтесь на фиксированные IP-адреса для верификации — используйте DNS-проверку, которую рекомендует сам оператор.

8. Открытый вопрос по категоризации

Стоит обратить внимание на разрыв между статусом «нежелательный» и фактическим уровнем прозрачности этого бота: у BublupBot есть открытая документация, точный UA, официальная DNS-верификация, заявленное самоограничение частоты запросов и прямой канал opt-out — это заметно выше стандарта для большинства записей в категории «Прочие краулеры и сервисы», где ничего из этого обычно нет. Статус «нежелательный», вероятно, оправдан именно отсутствием пользы для сайта (данные уходят в чужую рекомендательную базу без атрибуции), а не недобросовестностью самого бота — возможно, стоит явно различать эти два разных основания для одной и той же пометки в будущих статьях.

9. Стратегия allow/deny для BublupBot

Ситуация Действие
Сайт заинтересован в присутствии в рекомендациях Bublup Allow
Пользы нет, хочется чистого решения без технической возни Написать на info@bublup.com для добавления в «do not visit»
Пользы нет, нужна немедленная техническая блокировка Disallow + запрет в TrafficVeil
Нагрузка минимальна, беспокойства нет Не трогать — встроенный rate-limiting бота обычно этого достаточно
Подозрение на spoofing UA Использовать официальную DNS-верификацию (обратный + прямой DNS), а не догадки по ASN

Частые вопросы

Кто официально стоит за BublupBot?

Bublup, Inc. — сервис визуальной организации контента, который открыто публикует описание бота и инструкцию по его верификации.

Как реально проверить, что запрос от настоящего BublupBot?

Через обратный DNS IP-адреса (должен вести на домен, заканчивающийся на bublup.com) и последующий прямой DNS с тем же результатом.

Есть ли у BublupBot встроенные ограничения по нагрузке?

Да, оператор заявляет автоматический rate-limiting параллельных запросов к одному сайту.

Можно ли попросить Bublup вообще не посещать сайт?

Да, для этого есть официальный канал — письмо на info@bublup.com с просьбой добавить сайт в список «do not visit».

Почему статус в базе всё равно «нежелательный», если бот такой прозрачный?

Скорее всего потому, что прямой пользы для владельца сайта нет, а не из-за недобросовестности самого бота — это разные основания для одной пометки.

Стоит ли полагаться на список IP-адресов Bublup при настройке блокировки?

Нет, сам оператор предупреждает, что IP динамические и могут меняться без уведомления — надёжнее использовать DNS-верификацию.

#BublupBot#Bublup#User-Agent#антибот#DNS-верификация#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.