Боты6 мин чтения·12 августа 2026 г.·обновлено 8 сентября 2026 г.

Bl.uk_lddc_bot в логах: архивный краулер Британской библиотеки

Разбираем bl.uk_lddc_bot — краулер Британской библиотеки, который архивирует UK-контент по закону об обязательном экземпляре. Показываем, как найти его в access.log, проверить подлинность и настроить запрет через robots.txt, nginx или TrafficVeil.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота bl.uk_lddc_bot: нежелательный прочие краулеры и сервисы

В логах сайт может выглядеть «живым», хотя рост дают не посетители, а bl.uk_lddc_bot — краулер с User-Agent вида bl.uk_lddc_bot/3.x. Это архивный бот Британской библиотеки (British Library) и консорциума британских библиотек обязательного экземпляра: он обходит сайты, чтобы сохранить копию британского веба в рамках Legal Deposit Libraries Act 2003. Для владельца сайта, у которого нет прямой связи с UK-архивированием, это чисто служебный обход без выгоды — поэтому TrafficVeil помечает его как нежелательный: базовая рекомендация — запрет или жёсткий rate-limit.

1. Что такое bl.uk_lddc_bot

Это не анонимный скрипт — оператор известен и публично документирован. Бот принадлежит британским библиотекам обязательного экземпляра (Legal Deposit Libraries: British Library, Bodleian, Cambridge University Library и другие) и работает на движке Heritrix — том же открытом краулере, который использует Internet Archive. Технически задача бота — не SEO и не мониторинг доступности, а архивное копирование британского контента по закону.

Название bl.uk_lddc_bot
User-Agent / паттерн bl.uk_lddc_bot — версии встречались как bl.uk_lddc_bot/3.1.1, 3.3.0-LBS-2016-02, 3.4.0-20210803; иногда бот маскируется под браузер вида Mozilla/5.0 (bl.uk_lddc_bot; Linux x86_64) PhantomJS/1.9.7 (...) — это нужно ему для рендеринга страниц с JS
Оператор The British Library / консорциум британских библиотек обязательного экземпляра (Legal Deposit Libraries)
Роль Архивный обход UK-контента по мандату Legal Deposit Libraries Act 2003, на движке Heritrix
Документация / ориентир Официальная FAQ-страница для вебмастеров на bl.uk (раздел aboutus/legaldeposit/websites)
Список IP По независимым наблюдениям в блок входит диапазон 194.66.224.0/20 (родительская сеть JANET, 194.66.0.0/16) — данные не первой свежести, перед блокировкой по IP стоит перепроверить актуальность диапазона
robots.txt По собственному заявлению оператора — соблюдает, с кешированием правил на 24 часа; но контент, нужный для корректного рендеринга страницы (JS, CSS, изображения), может забираться даже вопреки Disallow
Пометка TrafficVeil Нежелательный / Прочие краулеры и сервисы

2. Зачем bl.uk_lddc_bot приходит на сайт

По собственному описанию оператора цель — собрать и сохранить копию каждого сайта, который относится к UK-сегменту веба, минимум раз в год; сайты, которые библиотеки считают представляющими особую культурную ценность, могут обходиться чаще. Отсюда и PhantomJS-обёртка в UA — без неё бот не смог бы корректно архивировать страницы, тяжело зависящие от JavaScript.

  • Какие зоны чаще трогает: публичные страницы сайта, а также встраиваемые ресурсы (CSS, изображения, скрипты), нужные для целостного отображения страницы;
  • Что ищет: полную копию контента для архивации, а не индекс для поиска или метрики доступности;
  • Чем отличается от браузерного пользователя: нет обычной сессии, визиты редкие и растянутые во времени (обычно не чаще раза в год на большинство сайтов), обход методичный и без выборочности.

Типичный кейс: маркетинг видит всплеск hits в Метрике или GA, но сессии пустые и без конверсий. Причина — bl.uk_lddc_bot. Правильная реакция — не «выключать сайт», а точечно ограничить именно этот UA через robots.txt или TrafficVeil.

3. Нагрузка и риски именно для bl.uk_lddc_bot

Отдельной строки в публичной сводке top-bot TrafficVeil у bl.uk_lddc_bot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Поскольку обход рассчитан на раз в год, разовый визит обычно некритичен по нагрузке — но если сайт крупный и глубоко проиндексирован ботом, единичный обход может растянуться на заметное число запросов подряд.

Отдельный нюанс: даже при настроенном Disallow бот, по собственному описанию оператора, может продолжать забирать ресурсы, технически необходимые для отображения страницы (JS/CSS/картинки) — если для вас принципиально полностью исключить его с сайта, одного robots.txt может быть недостаточно, и стоит закрывать доступ на уровне сервера.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти bl.uk_lddc_bot в логах

Не ищите «просто ботов» — ищите конкретный токен bl.uk_lddc_bot и рядом смотрите соседей по семейству архивных краулеров.

# Базовый поиск (grep -F — искать буквально, точка не экранируется как «любой символ»)
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить, приходил ли бот под PhantomJS-маской (для JS-рендеринга)
grep -i "bl.uk_lddc_bot.*phantomjs" /var/log/nginx/access.log | wc -l

# Отделить от похожих строк
grep -iE "bl.uk_lddc_bot|heritrix|archive.org_bot" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL. Публичного актуального реестра IP-диапазонов оператор не поддерживает в открытом доступе — опирайтесь на исторические данные сети JANET и на поведенческие признаки.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для bl.uk_lddc_bot

# Жёсткий запрет
User-agent: bl.uk_lddc_bot
Disallow: /

# Разрешить всё
User-agent: bl.uk_lddc_bot
Allow: /

# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: bl.uk_lddc_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: ставьте Disallow или 403 для bl.uk_lddc_bot, если пользы от него нет лично вам. Правила кешируются оператором на срок до 24 часов — изменения применяются не мгновенно. Если нужен полный и гарантированный запрет, переходите к правилам на уровне nginx/Apache или к блокировке в TrafficVeil, помня про исключение для рендер-критичных ресурсов.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "bl\.uk_lddc_bot") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=bluklddcbot:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "bl\.uk_lddc_bot") {
        limit_req zone=bluklddcbot burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} bl\.uk_lddc_bot [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите bl.uk_lddc_bot в ботах домена или в разделе /system/bots;
  • Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit;
  • Allow оставляйте только если ваш проект напрямую связан с UK legal deposit или архивированием;
  • После изменения сверьте логи: хиты bl.uk_lddc_bot должны уйти в блок или лимит, а поисковые роботы — остаться без изменений.

7. Рекомендации: что делать с bl.uk_lddc_bot

  • Если сайт не связан с UK и не заинтересован в архивации Британской библиотекой — Disallow/403 для bl.uk_lddc_bot;
  • Если польза есть (например, вы сознательно хотите попасть в архив UK-веба) — Allow, но контролируйте частоту через rate-limit;
  • Если нагрузка мешает, но резать совсем не хочется — сначала rate-limit, затем полный запрет;
  • Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
  • Что вы теряете при блокировке: как правило, ничего критичного для SEO или трафика — это архивный, а не поисковый или дистрибуционный бот.

8. С кем не путать bl.uk_lddc_bot

Бот / сосед Кластер UA Комментарий
360Spider Прочие краулеры и сервисы 360spider нежелательный
A360-Search Прочие краулеры и сервисы a360-search нежелательный
AASA-Bot Прочие краулеры и сервисы aasa-bot нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный
ActiveComply Прочие краулеры и сервисы activecomply нежелательный

9. Стратегия allow/deny для bl.uk_lddc_bot

Ситуация Действие
Сайт сознательно заинтересован в UK-архивации Allow + закрыть /admin /cart /api
Только мешает и жрёт ресурсы Disallow + запрет в TrafficVeil
Нужен контроль, но резать полностью не хочется Rate-limit на nginx/TrafficVeil
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA Не доверять строке UA; смотреть IP/ASN и поведение

Частые вопросы

bl.uk_lddc_bot — это спам-бот или сканер уязвимостей?
Нет, это официальный архивный краулер Британской библиотеки, который собирает копии UK-контента по закону об обязательном экземпляре, а не ищет уязвимости и не рассылает спам.
Почему бот приходит на сайт, если он не связан с Великобританией?
Оператор заявляет цель обходить весь UK-сегмент веба минимум раз в год — попадание под критерий может зависеть от домена, хостинга или контента, который сочли относящимся к UK.
Заблокирует ли robots.txt бота полностью?
Не всегда: по собственному описанию оператора, контент, необходимый для корректного отображения страницы (JS, CSS, изображения), может забираться даже вопреки Disallow.
Почему в логах бот иногда выглядит как обычный браузер?
Он подставляет PhantomJS-обёртку в User-Agent, когда ему нужно отрендерить страницу с активным JavaScript — это часть его штатной работы, а не подделка.
Есть ли смысл держать бота разрешённым ради SEO?
Обычно нет — это архивный, а не поисковый и не дистрибуционный бот, поэтому прямой пользы для позиций или трафика блокировка не отнимает.
Как быстро применится запрет в robots.txt?
Не мгновенно — оператор кеширует правила на срок до 24 часов, поэтому изменения стоит проверять в логах на следующий день, а не сразу после публикации.
#bl.uk_lddc_bot#Британская библиотека#Heritrix#архивные краулеры#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil