TrafficVeil
Боты 5 мин14 августа 2026 г.

Wget и robots.txt: правда сложнее, чем «обычно игнорирует»

По умолчанию wget на самом деле соблюдает robots.txt — но только при рекурсивном скачивании. Разбираем, когда файл вообще не запрашивается, и почему «нарушение» правил чаще осознанный выбор, а не баг.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Параметры
  2. На самом деле про robots.txt: не так однозначно, как кажется
  3. Зачем wget оказывается в логах
  4. Нагрузка
  5. Контроль
  6. Рекомендации
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

wget — утилита GNU wget для скачивания файлов по HTTP(S). В логах это автоматизация, не поисковый бот. Оператора «wget Inc.» не существует — это открытый инструмент командной строки, которым пользуется кто угодно: от разработчиков и системных администраторов до скраперов.

Параметры

Параметр Значение
UA Wget/1.x / wget/1.x
Оператор Не фиксирован (клиент — open-source утилита, а не сервис одной компании)
robots.txt Смотрите отдельный раздел ниже — распространённое «обычно игнорируется» неточно
IP ❌ Нет «официального» списка — это локальный инструмент, запускаемый где угодно

На самом деле про robots.txt: не так однозначно, как кажется

Официальное руководство GNU Wget прямо говорит: утилита соблюдает Robots Exclusion Standard (RES) **при рекурсивном скачивании** (флаг -r) — то есть именно тогда, когда wget ведёт себя как настоящий краулер, обходя сайт по ссылкам. Перед этим wget сам запрашивает robots.txt и учитывает его директивы по умолчанию. Для одиночной загрузки конкретного файла (самый частый сценарий: просто wget https://example.com/file.pdf без -r) robots.txt вообще не запрашивается — это не обход в смысле стандарта, а разовый fetch одного URL, к которому правило неприменимо по определению. Игнорирование robots.txt при рекурсивном обходе — не поведение по умолчанию, а осознанный выбор оператора, который явно передал флаг -e robots=off (или прописал robots = off в своём .wgetrc). Так что если в логах видна плотная рекурсивная выкачка сайта с явным нарушением директив — это, скорее всего, намеренное действие, а не «баг» или дефолтное поведение инструмента.

Зачем wget оказывается в логах

За этим UA может стоять что угодно — от легитимного мониторинга и внутренних интеграций до простого скрипта разработчика, тестирующего доступность страницы, до чужого скрапера, который просто не потрудился подделать UA под браузер. В отличие от многих ботов с одним конкретным назначением, wget — это универсальный инструмент без единого «типичного» сценария использования.

Нагрузка

По сводке TrafficVeil — порядка 35 тысяч запросов. Смотрите, свои ли это IP — при таком общем, generic-инструменте важнее понять, кто именно его запускает, чем сам факт присутствия в логах.

Контроль

grep -i "wget" /var/log/nginx/access.log
if ($http_user_agent ~* "wget") {
    return 403;
}

Рекомендации

  • Свои скрипты используют wget для мониторинга или интеграций — allowlist по IP, а не по UA (строку легко подделать в обе стороны)
  • Чужой wget без понятной цели — deny или rate-limit
  • Не путать с Googlebot и другими именованными поисковыми ботами — это универсальный инструмент, а не сервис одной компании
  • Если решаете судить бота по «нарушению» robots.txt — помните, что для нерекурсивных запросов файл вообще не запрашивается по умолчанию, так что само по себе отсутствие обращения к robots.txt в логах — не доказательство злого умысла

Частые вопросы

Правда ли, что wget по умолчанию игнорирует robots.txt?

Нет, при рекурсивном скачивании (флаг -r) утилита по умолчанию соблюдает файл — это подтверждено официальным руководством GNU Wget.

Почему тогда в логах кажется, что wget обходит правила?

Чаще всего это одиночная загрузка одного файла без флага -r, для которой robots.txt вообще не запрашивается, поскольку это не режим обхода.

Как оператор осознанно отключает соблюдение robots.txt?

Явно передав флаг -e robots=off в команде или прописав это в своём файле .wgetrc.

Есть ли официальный список IP для верификации трафика wget?

Нет, это локальная утилита командной строки, а не сервис с собственной инфраструктурой — списка не существует и не может существовать.

Как лучше всего разрешить доступ своим легитимным скриптам на wget?

Через allowlist по IP, а не по строке UA — её слишком легко подделать в обе стороны.

Означает ли отсутствие запроса к robots.txt в логах злой умысел?

Нет, для нерекурсивных запросов это нормальное поведение по умолчанию, а не признак игнорирования правил.

#wget#GNU wget#технические клиенты#robots.txt#TrafficVeil#verification
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.