TrafficVeil
Боты 7 мин21 августа 2026 г.

LeakIX Scanner: диагностический сигнал, а не угроза

LeakIX — реальная бельгийская security-компания с редким для этой категории уровнем прозрачности: каждая сканирующая машина криптографически проверяема через собственный поддомен и публичный PGP-ключ. Разбираемся, почему правильная реакция на находки этого сканера — чинить обнаруженное, а не воевать с ботом, и почему robots.txt здесь работает лишь частично, поскольку сканирование идёт не только по HTTP.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое LeakIX Scanner на самом деле
  2. 2. Зачем LeakIX Scanner приходит на сайт
  3. 3. Нагрузка и риски
  4. 4. Как найти LeakIX Scanner в логах
  5. 5. robots.txt для LeakIX Scanner
  6. 6. Блокировка вручную и через TrafficVeil — и официальный opt-out
  7. 7. Что делать: короткий алгоритм
  8. 8. С кем не путать LeakIX Scanner
  9. 9. Стратегия allow/deny для LeakIX Scanner
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

LeakIX — редкий случай, когда у security-сканера есть не только официальный оператор, но и криптографически проверяемая инфраструктура для подтверждения подлинности запроса: каждая сканирующая машина резолвится в собственный поддомен с открытым PGP-ключом. Это выгодно отличает LeakIX от большинства ботов в категории «Прочие краулеры и сервисы», где верификация сводится к «доверяйте IP/ASN на свой страх и риск».

1. Что такое LeakIX Scanner на самом деле

LeakIX — бельгийская кибербезопасность-компания LeakIX SRL, основанная в 2021 году Грегори Боденом и Дэнни Виллемсом (последний также CEO). Продукт — поисковая система по уязвимостям и утечкам данных в духе Shodan: непрерывное сканирование интернета для обнаружения незащищённых сервисов, неправильно сконфигурированных баз данных, открытых панелей администрирования и debug-эндпоинтов. Инструмент используют исследователи безопасности и red team-специалисты, чтобы найти уязвимости раньше злоумышленников.

Важная техническая особенность: каждая сканирующая машина LeakIX резолвится в собственный поддомен вида [идентификатор].scan.leakix.org, и по этому адресу доступна страница с объяснением происхождения пробы и публичным PGP-ключом для проверки её подлинности. Это встроенный, самообъясняющий механизм верификации — редкость среди ботов такого типа.

Параметр Значение
Название LeakIX Scanner
Оператор LeakIX SRL — бельгийская компания, основана в 2021 году
Роль Непрерывное сканирование интернета на предмет незащищённых сервисов, утечек данных и misconfiguration — для платформы поиска уязвимостей
User-Agent / паттерн leakix; связанный открытый инструмент l9explore также встречается в логах — библиотека сканирования опенсорсная, поэтому копии могут запускать и третьи лица независимо от самой компании LeakIX
Верификация Обратный DNS сканирующего IP резолвится в поддомен *.scan.leakix.org с публичной страницей и PGP-ключом для криптографической проверки подлинности пробы
Официальный opt-out Да — blacklist@leakix.net для исключения из сканирования
Особенность поведения Сканирует не только HTTP, но и широкий диапазон портов (22, 80, 443, 3306 и другие) — часть трафика вообще не несёт HTTP User-Agent
robots.txt Практического смысла не имеет — сканирование идёт на уровне портов и сервисов, а не только веб-страниц по правилам robots.txt
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы

2. Зачем LeakIX Scanner приходит на сайт

  • плановое интернет-сканирование на предмет открытых портов, экспонированных баз данных, панелей администрирования, Swagger UI, Docker registry и подобных сервисов, которые не должны быть публично доступны;
  • каталогизация находок в поисковую систему для исследователей безопасности — обнаруженные уязвимости индексируются, чтобы владелец мог их найти и исправить (или чтобы их нашли раньше злоумышленников);
  • при обнаружении крупных утечек LeakIX уведомляет организацию напрямую и даёт время на исправление, прежде чем публиковать находку.

Типичный кейс: в логах видно, что LeakIX запрашивает пути вроде /actuator, Swagger-эндпоинты, конфигурационные файлы или пытается достучаться до сервисов, которых на сайте физически нет (например, на WordPress-стеке запрашивается Laravel Telescope) — большинство таких запросов закономерно получают 404, и это ожидаемое, безобидное поведение проверки широкого набора известных паттернов.

3. Нагрузка и риски

Ключевой практический принцип для LeakIX, отличающий его от типичного «прочего сервиса»: паттерн сканирования технически неотличим от разведки перед атакой — потому что это буквально то же самое действие, просто выполненное исследователем, а не злоумышленником. Реальный риск не в самом факте сканирования, а в том, что оно может обнаружить.

Практическое правило, которое стоит внедрить: если LeakIX в логах получает 404 или 444 (уже отклонено существующими правилами безопасности) — всё в порядке, происходящее ожидаемо. Если же LeakIX получает 200 на что-то неожиданное — это не повод жаловаться на бота, а сигнал немедленно проверить находку: если её видит LeakIX, её так же легко увидит и настоящий злоумышленник.

4. Как найти LeakIX Scanner в логах

# Базовый поиск
grep -i "leakix" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "leakix" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "leakix" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Проверка на неожиданные 200-ответы — это то, на что стоит реагировать в первую очередь
grep -i "leakix" /var/log/nginx/access.log | awk '$9 == 200 {print $7}' | sort -u

# Связанный опенсорсный инструмент — тоже стоит искать отдельно
grep -i "l9explore" /var/log/nginx/access.log

Верификация. В отличие от большинства ботов в этой энциклопедии, здесь есть реальный, задокументированный способ проверки — обратный DNS сканирующего IP должен вести на поддомен вида *.scan.leakix.org, а подлинность самой пробы можно проверить криптографически через опубликованный PGP-ключ:

# Обратный DNS должен вести на поддомен scan.leakix.org
dig +short -x "$IP"

# Проверка подлинности пробы через PGP
curl -s https://leakix.net/probe.asc | gpg --import -
curl -s "<хост>.scan.leakix.org" | gpg --verify

Учитывайте нюанс: сам сканер LeakIX опенсорсный, поэтому UA l9explore или похожие паттерны может запускать кто угодно вне официальной инфраструктуры компании — DNS/PGP-проверка выше относится именно к официальным пробам LeakIX SRL, а не к любому трафику с похожим именем.

5. robots.txt для LeakIX Scanner

# Жёсткий запрет — как правило, малоэффективен, т.к. сканирование идёт на уровне портов
User-agent: leakix
Disallow: /

# Разрешить всё — рекомендуемый вариант, если фактических находок 200 нет
User-agent: leakix
Allow: /

Файл robots.txt здесь имеет ограниченную практическую ценность: значительная часть активности LeakIX — сканирование портов и сервисов вне HTTP, на что правила robots.txt в принципе не распространяются.

6. Блокировка вручную и через TrafficVeil — и официальный opt-out

Nginx:

if ($http_user_agent ~* "leakix") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=leakix:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "leakix") {
        limit_req zone=leakix burst=20 nodelay;
    }
}

Apache (.htaccess):

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} leakix [NC]
RewriteRule ^ - [F,L]

TrafficVeil:

  • найдите leakix в разделе ботов домена или в /system/bots;
  • прежде чем блокировать — проверьте, не получает ли бот неожиданные 200-ответы: это более ценная информация, чем сам факт сканирования;
  • для полного исключения из сканирования есть чистый официальный путь — написать на blacklist@leakix.net, а не только настраивать техническую блокировку;
  • помните, что технический deny по UA не остановит сканирование портов вне HTTP — для этого нужны меры на уровне файрвола/сетевой инфраструктуры, а не только веб-сервера.

7. Что делать: короткий алгоритм

  • Все запросы LeakIX получают 404/444 — не трогайте, это ожидаемое и безобидное поведение;
  • LeakIX получает 200 на что-то, что не должно быть публично доступно — немедленно устраните находку, а не боритесь с ботом;
  • Хотите полностью исключить сайт из сканирования — используйте официальный opt-out по email, это чище, чем только техническая блокировка;
  • Заметна нагрузка на уровне портов вне HTTP — решается на уровне файрвола/сетевой защиты, а не robots.txt;
  • Не блокируйте по маске User-agent: *, чтобы не задеть Googlebot/YandexBot заодно.

8. С кем не путать LeakIX Scanner

Бот / сосед Кластер Комментарий
AgentReadinessScanner Прочие краулеры и сервисы Похожая природа — Cloudflare-сканер готовности к AI-агентам, тоже security/readiness-профиль, а не content-краулер
Shodan Не в базе TrafficVeil, но стоит знать Прямой аналог LeakIX — крупнейший поисковик по интернет-устройствам с похожей моделью сканирования
l9explore Открытый инструмент, связанный с LeakIX Опенсорсная библиотека сканирования — может запускаться третьими лицами независимо от компании LeakIX
2ip Bot Прочие краулеры и сервисы легитимный, но принципиально другая природа — обычный мониторинговый сервис без security-профиля

9. Стратегия allow/deny для LeakIX Scanner

Ситуация Действие
Сканирование безобидно (404/444 на все запросы) Allow — не тратить силы на борьбу с полезным диагностическим сигналом
Обнаружен неожиданный 200-ответ Исправить находку в первую очередь, бот тут вторичен
Хотите полностью исключить сайт Официальный opt-out через blacklist@leakix.net
Нагрузка на уровне портов вне HTTP Решать на уровне файрвола/сети, а не robots.txt
Подозрение на трафик от копии сканера вне официальной инфраструктуры LeakIX Проверять через обратный DNS на *.scan.leakix.org — не любой похожий UA официальный

Частые вопросы

LeakIX — это вредоносный сканер, маскирующийся под исследователей?

Нет, это реальная бельгийская компания LeakIX SRL с легитимным продуктом для поиска уязвимостей, уважаемая в security-сообществе.

Как реально проверить подлинность запроса от LeakIX?

Через обратный DNS сканирующего IP на поддомен *.scan.leakix.org и криптографическую проверку пробы опубликованным PGP-ключом.

Что делать, если LeakIX получил доступ к чему-то, чего не должно быть публично?

Немедленно исправить находку — это более важная задача, чем блокировка самого сканера.

Работает ли robots.txt против LeakIX?

Лишь частично — значительная часть сканирования идёт на уровне портов вне HTTP, где правила robots.txt не действуют.

Можно ли полностью исключить сайт из сканирования LeakIX?

Да, через официальный канал — письмо на blacklist@leakix.net.

Любой трафик с похожим на LeakIX UA — точно от самой компании?

Не обязательно — используемый сканер опенсорсный, и копии могут запускать третьи лица независимо от LeakIX SRL.

#LeakIX#security-сканер#утечки данных#User-Agent#PGP-верификация#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.