Argus NGB Crawler — автоматизированный HTTP-клиент, который в логах может определяться по токену argus-ngb. На момент проверки нам не удалось найти надёжную публичную документацию, которая однозначно связывала бы этот User-Agent с конкретной организацией, продуктом или официальным оператором.
Поэтому корректнее всего классифицировать его как неподтверждённый сервисный crawler, а не автоматически считать официальным регуляторным, поисковым или мониторинговым ботом.
| Параметр | Значение |
|---|---|
| Название | Argus NGB Crawler |
| User-Agent / паттерн | argus-ngb |
| Оператор | Не подтверждён |
| Категория | Неидентифицированные сервисные краулеры |
| Назначение | Не подтверждено публичной документацией |
| Официальный IP feed | Не найден |
| Официальная DNS-верификация | Не найдена |
| Политика robots.txt | Не подтверждена |
| Статус TrafficVeil | Observed / Low confidence |
Почему важно не приписывать Argus NGB Crawler неподтверждённого оператора
Само название User-Agent может выглядеть убедительно, но оно не является доказательством происхождения запроса. Аббревиатуры и названия вроде Argus и NGB используются множеством несвязанных организаций и продуктов.
Поэтому TrafficVeil не должен выводить в карточке бота конкретного владельца, если нет хотя бы одного сильного подтверждения:
- официальной документации оператора;
- страницы с описанием User-Agent;
- официального списка IP-диапазонов;
- проверяемого reverse DNS;
- публичного ASN или иной стабильной инфраструктуры;
- ссылки из самого User-Agent на подтверждённый домен.
Если таких данных нет, лучше честно показывать «оператор не подтверждён», чем создавать ложное ощущение доверенного трафика.
Что означает появление argus-ngb в access.log
Сам факт появления argus-ngb означает только одно: HTTP-клиент сообщил этот идентификатор в User-Agent или другой анализируемой строке.
Это машинный запрос, но его реальное назначение следует определять по поведению:
- какие URL он посещает;
- как часто возвращается;
- какие HTTP-методы использует;
- сколько IP задействовано;
- из каких ASN приходит трафик;
- есть ли стабильный fingerprint;
- похож ли паттерн на monitoring, crawling, scraping или security scanning.
Почему User-Agent нельзя считать подтверждением личности
User-Agent — обычный HTTP-заголовок. Любой скрипт может отправить:
User-Agent: argus-ngb
Поэтому совпадение строки должно использоваться только как первичный сигнал классификации.
Более надёжная схема TrafficVeil:
- обнаружить UA;
- определить IP;
- определить ASN и организацию сети;
- проверить reverse DNS;
- сопоставить TLS/HTTP fingerprint;
- проанализировать URL и частоту;
- сравнить с предыдущими визитами;
- только после этого повышать confidence.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти Argus NGB Crawler в логах
Базовый поиск:
grep -i "argus-ngb" /var/log/nginx/access.log
Топ URL:
grep -i "argus-ngb" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort | uniq -c | sort -rn | head -30
Топ IP:
grep -i "argus-ngb" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort | uniq -c | sort -rn | head -30
Коды ответа:
grep -i "argus-ngb" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort | uniq -c | sort -rn
Количество уникальных IP:
grep -i "argus-ngb" /var/log/nginx/access.log \
| awk '{print $1}' | sort -u | wc -l
Какие URL особенно важны при анализе
Профиль URL часто помогает понять назначение неизвестного crawler быстрее, чем его название.
| Паттерн | Что может означать |
|---|---|
Только / или несколько публичных страниц |
Availability check или простой сервисный probe |
| Последовательный обход многих HTML-страниц | Web crawling / indexing / scraping |
| Повтор одного URL через равные интервалы | Synthetic monitoring |
| Большое число API endpoint | Интеграция, API monitoring или автоматизация |
/.env, backups, админки, exploit paths |
Поведение не соответствует обычному легитимному crawler |
Как проверить IP и ASN
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
Эти команды помогают определить сеть и PTR, но сами по себе тоже не гарантируют подлинность.
Для TrafficVeil лучше сохранять историю наблюдений:
- первое появление IP;
- последнее появление;
- ASN;
- ASN organization;
- network type;
- reverse DNS;
- User-Agent;
- fingerprint;
- частоту запросов.
Observed IP и Verified IP — это разные вещи
Если TrafficVeil увидел argus-ngb с определённого IP, это означает только Observed IP.
Такой адрес нельзя автоматически добавлять в официальный allowlist. Для этого требуется подтверждение оператора или достаточно сильная совокупность независимых сигналов.
| Тип | Значение |
|---|---|
| Observed IP | С этого IP TrafficVeil видел данный UA |
| Probable IP | Инфраструктура и поведение согласуются с предыдущими наблюдениями |
| Verified IP | Адрес подтверждён официальным оператором или проверяемым механизмом |
Какая нагрузка считается нормальной
У неизвестного crawler невозможно заранее определить «правильный» RPS. Поэтому важнее сравнивать запросы с нормальным профилем сайта.
Следите за:
- RPS и RPM;
- числом уникальных URL;
- долей повторных запросов;
- response bytes;
- cache HIT/MISS;
- нагрузкой на origin;
- параллельными соединениями;
- кодами 4xx и 5xx;
- временем ответа.
Несколько тысяч запросов за длительный период могут практически не влиять на сервер. Те же несколько тысяч запросов за короткий интервал к тяжёлым динамическим URL могут стать заметной нагрузкой.
robots.txt для argus-ngb
Если владелец сайта хочет явно объявить запрет:
User-agent: argus-ngb
Disallow: /
Для частичного ограничения:
User-agent: argus-ngb
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Disallow: /internal/
Но подтверждённой публичной политики соблюдения robots.txt для этого агента нам найти не удалось.
Поэтому robots.txt следует считать декларацией. Если запросы необходимо гарантированно остановить, используйте WAF, reverse proxy или TrafficVeil.
Блокировка через Nginx
if ($http_user_agent ~* "argus-ngb") {
return 403;
}
Блокировка через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} argus-ngb [NC]
RewriteRule ^ - [F,L]
Оба правила работают только по строке User-Agent. Они не проверяют, кто фактически отправил запрос.
Rate Limit вместо полного запрета
Для неизвестного, но неагрессивного crawler часто разумнее сначала ограничить частоту, а уже затем решать вопрос о полном блокировании.
Подход подходит, если:
- назначение бота не подтверждено;
- вредоносного поведения нет;
- обход создаёт измеримую нагрузку;
- владелец сайта не хочет полностью закрывать доступ неизвестным сервисам.
Как отличить сервисный crawler от подозрительного трафика
| Признак | Обычная автоматизация | Подозрительный профиль |
|---|---|---|
| URL | Публичные страницы или стабильный набор endpoint | Конфиги, backup, exploit paths |
| Частота | Стабильная или умеренная | Резкие высокочастотные всплески |
| IP/ASN | Повторяемая инфраструктура | Много несвязанных residential/proxy IP |
| Fingerprint | Стабильный | Резко меняется при одном UA |
| Методы | GET/HEAD или ожидаемые запросы | Необъяснимый перебор методов и payload |
Как классифицировать Argus NGB Crawler в TrafficVeil
| Поле | Рекомендация |
|---|---|
| Название | Argus NGB Crawler |
| UA | argus-ngb |
| Оператор | Unknown / Unverified |
| Категория | Неидентифицированные сервисные краулеры |
| Identity confidence | Low |
| Verified IP ranges | Нет |
| robots.txt compliance | Unknown |
| Default action | Monitor |
| Rate Limit | При чрезмерной активности |
| Block | Если пользы нет или обнаружено нежелательное поведение |
Почему Default = Monitor лучше, чем автоматический Allow
Статус «легитимный» должен означать, что TrafficVeil имеет достаточные основания доверять идентификации. Для argus-ngb такой базы пока недостаточно.
Автоматический Allow создаёт риск того, что любой клиент с поддельным UA получит привилегированный доступ.
Автоматический Block тоже может быть избыточным, если агент выполняет безвредную сервисную функцию.
Поэтому оптимальный вариант:
Observed → Monitor → собрать телеметрию → повысить или понизить confidence → применить Allow / Rate Limit / Block.
Что стоит добавить в TrafficVeil для неизвестных ботов
Argus NGB Crawler хорошо показывает, почему одной колонки «легитимный / нежелательный» недостаточно.
Полезно добавить:
- Identity confidence — Verified, High, Medium, Low, Unknown;
- Observed since — когда агент впервые появился в данных TrafficVeil;
- Observed IPs;
- Observed ASNs;
- Verified ranges отдельно от наблюдаемых;
- Behavior profile — monitoring, crawling, scraping, scanning;
- UA spoofing risk;
- Recommended action с объяснением причины.
Итог
Argus NGB Crawler с токеном argus-ngb следует считать наблюдаемым, но пока недостаточно документированным автоматизированным клиентом. Надёжного публичного подтверждения оператора, официального IP feed, DNS-механизма верификации и политики robots.txt на момент проверки найти не удалось.
Поэтому TrafficVeil не стоит автоматически присваивать ему статус доверенного бота. Лучший default — Monitor / Low confidence с анализом IP, ASN, fingerprint, частоты и набора URL.
Если дальнейшие наблюдения или официальная документация подтвердят оператора и назначение, карточку можно повысить до Verified. Пока же точность важнее красивой, но неподтверждённой атрибуции.
Частые вопросы
Что такое Argus NGB Crawler?
Известно ли, кому принадлежит argus-ngb?
Можно ли считать запрос легитимным только потому, что User-Agent содержит argus-ngb?
Как проверить Argus NGB Crawler в логах?
Соблюдает ли argus-ngb robots.txt?
Какое действие лучше установить для argus-ngb в TrafficVeil?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.