TrafficVeil
Боты 7 мин13 августа 2026 г.

LeakIX ScannerLeakIX Scanner в логах: не просто краулер, а сканер портов

Разбираем LeakIX Scanner (l9scan) — security-инструмент, который сканирует не только веб-страницы, но и открытые порты сервисов. Показываем официальный список IP, почему robots.txt здесь малоэффективен, и почему репутация сервиса в сообществе неоднозначная.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое LeakIX Scanner
  2. 2. Зачем LeakIX Scanner приходит на сайт
  3. 3. Нагрузка и риски именно для LeakIX Scanner
  4. 4. Как найти LeakIX Scanner в логах
  5. 5. robots.txt для LeakIX Scanner
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с LeakIX Scanner
  8. 8. С кем не путать LeakIX Scanner
  9. 9. Стратегия allow/deny для LeakIX Scanner
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

В логах сайт может выглядеть «живым», хотя рост даёт не аудитория, а LeakIX Scanner с User-Agent l9scan. LeakIX — реальная платформа для обнаружения утечек данных и неправильных конфигураций в интернете (leakix.net), которая предоставляет исследователям и security-специалистам поисковик по найденным уязвимым сервисам. Но однозначно называть её «легитимным сервисом» без оговорок не совсем точно: в сообществе вебмастеров и security-специалистов отношение к LeakIX заметно расходится.

1. Что такое LeakIX Scanner

LeakIX сканирует интернет не только по HTTP — сканер проверяет широкий диапазон портов (22, 80, 443, 3306 и другие типично уязвимые), то есть по сути это полноценный интернет-сканер сервисов, а не просто веб-краулер, вычитывающий страницы. Инструментарий LeakIX открытый (доступен на GitHub, включая компоненты l9synscan и родственные l9explore, l9scan), поэтому один и тот же UA теоретически может генерировать не только сама компания LeakIX, но и любой третьей стороной, которая запустила тот же open-source инструмент у себя — совпадение UA само по себе не доказывает, что сканирует именно официальная инфраструктура LeakIX.

Название LeakIX Scanner
User-Agent / паттерн l9scan; родственные токены того же семейства — l9explore, l9synscan
Оператор LeakIX (leakix.net) — но сканер открытый, поэтому копии могут запускать и не связанные с компанией третьи стороны
Роль Обнаружение открытых/уязвимых сервисов и утечек через misconfiguration — включает как HTTP-запросы, так и сканирование портов служб за пределами веба
Документация / ориентир leakix.net и scan.leakix.net — включая страницу «10 заповедей этичного интернет-сканирования»
Список IP ✅ Официально публикуется на scan.leakix.net в форматах JSON, CSV и готовых правил iptables — редкий случай полноты именно для «security research» бота; сверяйтесь с этим списком, а не доверяйте только строке UA
robots.txt По независимым данным, ноль процентов топовых сайтов не блокируют l9scan через robots.txt именно потому, что это малоэффективно: значительная часть активности LeakIX — не HTTP-обход, а сканирование портов, на которое сам файл robots.txt в принципе не распространяется
Пометка TrafficVeil Легитимный / Прочие краулеры и сервисы — с оговоркой: репутация в сообществе неоднозначная

2. Зачем LeakIX Scanner приходит на сайт

Заявленная цель — исследовательская: находить публично доступные, но при этом небезопасно настроенные сервисы (открытые базы данных, .git-репозитории с чувствительными данными и подобное) и, по декларации оператора, способствовать их устранению через ответственное раскрытие. Но стоит знать, что мнения опытных вебмастеров и системных администраторов на этот счёт расходятся: в публичных обсуждениях встречаются как оценки «полезный исследовательский инструмент», так и куда более резкие — «чёрные хакеры под белым соусом security research», вплоть до предположений, что подобные площадки могут непреднамеренно выполнять разведывательную работу в интересах куда менее благих акторов, просто оформленную как открытое исследовательское сообщество.

  • Какие зоны чаще трогает: публичные URL, но также — и это важно — открытые порты и сервисы за пределами HTTP (базы данных, административные интерфейсы, .git и подобное);
  • Что ищет: признаки неправильной конфигурации и утечек, а не контент в привычном для этой энциклопедии смысле;
  • Чем отличается от браузерного пользователя: нет нормальной сессии, поведение ближе к security-сканеру, чем к контентному краулеру — отсюда и специфический профиль риска.

Типичный кейс: ночью RPS растёт, конверсий нет. В access.log доминирует l9scan на пагинации и карточках — но параллельно стоит проверить и не-HTTP порты сервера: если сканирование port range тоже присутствует, это подтверждает, что перед вами полноценный security-сканер, а не обычный контентный бот.

3. Нагрузка и риски именно для LeakIX Scanner

Отдельной строки в публичной сводке top-bot TrafficVeil у l9scan может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: фоновый шум в аналитике, расход CPU/bandwidth и искажение статистики «живого» трафика. Для LeakIX практический риск шире обычного: раз сканирование затрагивает и открытые порты за пределами веба, стоит воспользоваться визитом бота как поводом самостоятельно проверить, не выставлены ли наружу базы данных, административные панели или служебные репозитории — именно это LeakIX и ищет, и если находит раньше вас, это может стать проблемой независимо от намерений самого сканера.

4. Как найти LeakIX Scanner в логах

Не ищите «просто ботов» — ищите конкретный токен l9scan и рядом смотрите соседей по семейству инструментов LeakIX.

# Базовый поиск по семейству токенов LeakIX
grep -iE "l9scan|l9explore|l9synscan" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "l9scan" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA — сверьте со списком на scan.leakix.net
grep -i "l9scan" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "l9scan" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Отдельно проверьте попытки подключения на нетипичные для веба порты — это отличит security-сканер от обычного HTTP-бота
sudo ss -tn state established '( dport = :3306 or dport = :22 )'

Верификация. Подделать User-Agent может любой скрипт, и для LeakIX это особенно актуально: сканер открытый, поэтому одинаковый UA может принадлежать как официальной инфраструктуре LeakIX, так и любой сторонней копии инструмента. LeakIX официально публикует список своих собственных IP на scan.leakix.net (JSON/CSV/iptables) — сверяйтесь именно с ним, чтобы отличить официальный трафик LeakIX от стороннего запуска того же open-source сканера.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для LeakIX Scanner

# Технически можно прописать, но по опыту сообщества малоэффективно —
# значительная часть активности LeakIX выходит за рамки HTTP-обхода
User-agent: l9scan
Disallow: /

Важно: опытные администраторы прямо указывают, что блокировка через robots.txt или даже по User-Agent «не имеет большого смысла» для такого инструмента — часть его работы это сканирование портов, которое находится вне досягаемости и логики robots.txt в принципе. Для реального контроля нужны firewall-правила и блокировка по официальному списку IP с scan.leakix.net, а не текстовый файл с просьбой не заходить.

6. Блокировка вручную и через TrafficVeil

Nginx (только HTTP-часть трафика)

if ($http_user_agent ~* "l9scan") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=l9scan:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "l9scan") {
        limit_req zone=l9scan burst=20 nodelay;
    }
}

Firewall (для не-HTTP сканирования портов)

# Используйте официальный список IP с scan.leakix.net (формат iptables доступен напрямую)
# вместо попытки блокировать поведение только на уровне веб-сервера

TrafficVeil

  • Найдите l9scan в ботах домена или в /system/bots;
  • Для нежелательного сценария — категорию «запретить», но помните, что HTTP-правило не остановит сканирование прочих портов;
  • Allow только при явной пользе — например, если вы сознательно используете LeakIX для аудита собственной инфраструктуры;
  • После изменения сверьте логи и, отдельно, состояние открытых портов на сервере — визит LeakIX стоит использовать как повод для собственной проверки periметра.

7. Рекомендации: что делать с LeakIX Scanner

  • Если пользы нет — Disallow/403 для l9scan на HTTP-уровне, но дополнительно закройте на firewall лишние порты — сама блокировка веб-запросов не остановит сканирование сервисов;
  • Используйте визит бота как повод для собственного аудита: проверьте, не открыты ли наружу база данных, .git или административные интерфейсы;
  • Если польза есть (сознательно используете сервис для собственного мониторинга безопасности) — Allow;
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot;
  • Что будет при блокировке: обычно ничего критичного для SEO не теряете; при этом полноценная защита требует мер шире, чем просто веб-правило.

8. С кем не путать LeakIX Scanner

Бот / сосед Кластер UA Комментарий
l9explore Прочие краулеры и сервисы l9explore тот же оператор/семейство инструментов LeakIX
l9synscan Прочие краулеры и сервисы l9synscan открытый компонент семейства LeakIX (SYN-сканер)
2ip Bot Прочие краулеры и сервисы 2ip bot легитимный, не связан с LeakIX
AccessStatus Прочие краулеры и сервисы accessstatus легитимный
AddThis.com Прочие краулеры и сервисы addthis.com легитимный

9. Стратегия allow/deny для LeakIX Scanner

Ситуация Действие
Сознательно используете LeakIX для аудита своей инфраструктуры Allow + закрыть /admin /cart /api
Только мешает и жрёт ресурсы Disallow на HTTP + firewall-правила по официальному IP-списку
Обнаружили открытые порты/сервисы при проверке визита Закрыть лишние порты firewall независимо от политики по самому боту
Нежелательный по базе TrafficVeil Deny по умолчанию, исключения — точечно
Подозрение на spoofing UA / стороннюю копию сканера Сверять с официальным IP-списком scan.leakix.net, не доверять только совпадению строки UA

Частые вопросы

LeakIX Scanner — это однозначно легитимный сервис?

Не совсем однозначно: в сообществе вебмастеров и security-специалистов мнения расходятся, от «полезный исследовательский инструмент» до куда более резких оценок его настоящих целей.

Сработает ли robots.txt против этого бота?

Малоэффективно — значительная часть активности LeakIX это сканирование портов за пределами HTTP, на которое сам файл robots.txt в принципе не распространяется.

Публикует ли LeakIX официальный список IP?

Да, на scan.leakix.net доступен список в форматах JSON, CSV и готовых правил iptables — редкий случай полноты для инструмента такого типа.

Может ли под этим UA скрываться не сама LeakIX?

Да, инструмент открытый (доступен на GitHub), поэтому такой же UA может генерировать любая третья сторона, запустившая копию сканера независимо от компании.

Что стоит сделать при визите этого бота, помимо блокировки?

Использовать это как повод проверить собственный периметр — не открыты ли наружу база данных, .git-репозиторий или административные интерфейсы, поскольку именно это сканер и ищет.

Достаточно ли заблокировать User-Agent на веб-сервере для полной защиты?

Нет, поскольку часть активности идёт мимо HTTP — для полноценного контроля нужны firewall-правила по официальному IP-списку, а не только правило для веб-сервера.

#LeakIX#l9scan#security-сканер#анализ логов#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.