В логах сайт может выглядеть «живым», хотя рост дают не посетители, а bl.uk_lddc_bot — краулер с User-Agent вида bl.uk_lddc_bot/3.x. Это архивный бот Британской библиотеки (British Library) и консорциума британских библиотек обязательного экземпляра: он обходит сайты, чтобы сохранить копию британского веба в рамках Legal Deposit Libraries Act 2003. Для владельца сайта, у которого нет прямой связи с UK-архивированием, это чисто служебный обход без выгоды — поэтому TrafficVeil помечает его как нежелательный: базовая рекомендация — запрет или жёсткий rate-limit.
1. Что такое bl.uk_lddc_bot
Это не анонимный скрипт — оператор известен и публично документирован. Бот принадлежит британским библиотекам обязательного экземпляра (Legal Deposit Libraries: British Library, Bodleian, Cambridge University Library и другие) и работает на движке Heritrix — том же открытом краулере, который использует Internet Archive. Технически задача бота — не SEO и не мониторинг доступности, а архивное копирование британского контента по закону.
| Название | bl.uk_lddc_bot |
| User-Agent / паттерн | bl.uk_lddc_bot — версии встречались как bl.uk_lddc_bot/3.1.1, 3.3.0-LBS-2016-02, 3.4.0-20210803; иногда бот маскируется под браузер вида Mozilla/5.0 (bl.uk_lddc_bot; Linux x86_64) PhantomJS/1.9.7 (...) — это нужно ему для рендеринга страниц с JS |
| Оператор | The British Library / консорциум британских библиотек обязательного экземпляра (Legal Deposit Libraries) |
| Роль | Архивный обход UK-контента по мандату Legal Deposit Libraries Act 2003, на движке Heritrix |
| Документация / ориентир | Официальная FAQ-страница для вебмастеров на bl.uk (раздел aboutus/legaldeposit/websites) |
| Список IP | По независимым наблюдениям в блок входит диапазон 194.66.224.0/20 (родительская сеть JANET, 194.66.0.0/16) — данные не первой свежести, перед блокировкой по IP стоит перепроверить актуальность диапазона |
| robots.txt | По собственному заявлению оператора — соблюдает, с кешированием правил на 24 часа; но контент, нужный для корректного рендеринга страницы (JS, CSS, изображения), может забираться даже вопреки Disallow |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем bl.uk_lddc_bot приходит на сайт
По собственному описанию оператора цель — собрать и сохранить копию каждого сайта, который относится к UK-сегменту веба, минимум раз в год; сайты, которые библиотеки считают представляющими особую культурную ценность, могут обходиться чаще. Отсюда и PhantomJS-обёртка в UA — без неё бот не смог бы корректно архивировать страницы, тяжело зависящие от JavaScript.
- Какие зоны чаще трогает: публичные страницы сайта, а также встраиваемые ресурсы (CSS, изображения, скрипты), нужные для целостного отображения страницы;
- Что ищет: полную копию контента для архивации, а не индекс для поиска или метрики доступности;
- Чем отличается от браузерного пользователя: нет обычной сессии, визиты редкие и растянутые во времени (обычно не чаще раза в год на большинство сайтов), обход методичный и без выборочности.
Типичный кейс: маркетинг видит всплеск hits в Метрике или GA, но сессии пустые и без конверсий. Причина — bl.uk_lddc_bot. Правильная реакция — не «выключать сайт», а точечно ограничить именно этот UA через robots.txt или TrafficVeil.
3. Нагрузка и риски именно для bl.uk_lddc_bot
Отдельной строки в публичной сводке top-bot TrafficVeil у bl.uk_lddc_bot может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Поскольку обход рассчитан на раз в год, разовый визит обычно некритичен по нагрузке — но если сайт крупный и глубоко проиндексирован ботом, единичный обход может растянуться на заметное число запросов подряд.
Отдельный нюанс: даже при настроенном Disallow бот, по собственному описанию оператора, может продолжать забирать ресурсы, технически необходимые для отображения страницы (JS/CSS/картинки) — если для вас принципиально полностью исключить его с сайта, одного robots.txt может быть недостаточно, и стоит закрывать доступ на уровне сервера.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти bl.uk_lddc_bot в логах
Не ищите «просто ботов» — ищите конкретный токен bl.uk_lddc_bot и рядом смотрите соседей по семейству архивных краулеров.
# Базовый поиск (grep -F — искать буквально, точка не экранируется как «любой символ»)
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -iF "bl.uk_lddc_bot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить, приходил ли бот под PhantomJS-маской (для JS-рендеринга)
grep -i "bl.uk_lddc_bot.*phantomjs" /var/log/nginx/access.log | wc -l
# Отделить от похожих строк
grep -iE "bl.uk_lddc_bot|heritrix|archive.org_bot" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + ASN/IP + частоту + набор URL. Публичного актуального реестра IP-диапазонов оператор не поддерживает в открытом доступе — опирайтесь на исторические данные сети JANET и на поведенческие признаки.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для bl.uk_lddc_bot
# Жёсткий запрет
User-agent: bl.uk_lddc_bot
Disallow: /
# Разрешить всё
User-agent: bl.uk_lddc_bot
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: bl.uk_lddc_bot
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow или 403 для bl.uk_lddc_bot, если пользы от него нет лично вам. Правила кешируются оператором на срок до 24 часов — изменения применяются не мгновенно. Если нужен полный и гарантированный запрет, переходите к правилам на уровне nginx/Apache или к блокировке в TrafficVeil, помня про исключение для рендер-критичных ресурсов.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "bl\.uk_lddc_bot") {
return 403;
}
limit_req_zone $binary_remote_addr zone=bluklddcbot:10m rate=10r/m;
location / {
if ($http_user_agent ~* "bl\.uk_lddc_bot") {
limit_req zone=bluklddcbot burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} bl\.uk_lddc_bot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите bl.uk_lddc_bot в ботах домена или в разделе /system/bots;
- Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit;
- Allow оставляйте только если ваш проект напрямую связан с UK legal deposit или архивированием;
- После изменения сверьте логи: хиты bl.uk_lddc_bot должны уйти в блок или лимит, а поисковые роботы — остаться без изменений.
7. Рекомендации: что делать с bl.uk_lddc_bot
- Если сайт не связан с UK и не заинтересован в архивации Британской библиотекой — Disallow/403 для bl.uk_lddc_bot;
- Если польза есть (например, вы сознательно хотите попасть в архив UK-веба) — Allow, но контролируйте частоту через rate-limit;
- Если нагрузка мешает, но резать совсем не хочется — сначала rate-limit, затем полный запрет;
- Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
- Что вы теряете при блокировке: как правило, ничего критичного для SEO или трафика — это архивный, а не поисковый или дистрибуционный бот.
8. С кем не путать bl.uk_lddc_bot
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
9. Стратегия allow/deny для bl.uk_lddc_bot
| Ситуация | Действие |
| Сайт сознательно заинтересован в UK-архивации | Allow + закрыть /admin /cart /api |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil |
| Нужен контроль, но резать полностью не хочется | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP/ASN и поведение |
Частые вопросы
bl.uk_lddc_bot — это спам-бот или сканер уязвимостей?
Почему бот приходит на сайт, если он не связан с Великобританией?
Заблокирует ли robots.txt бота полностью?
Почему в логах бот иногда выглядит как обычный браузер?
Есть ли смысл держать бота разрешённым ради SEO?
Как быстро применится запрет в robots.txt?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.