Боты4 мин чтения·11 августа 2026 г.

WellKnownBot: сам оператор настаивает, что это не краулер — и это меняет правила игры для robots.txt

По официальному описанию проекта well-known.dev, WellKnownBot — не веб-краулер, а узкоспециализированный инструмент, сканирующий лишь несколько конкретных публичных well-known-файлов. Разбираем, почему именно эта классификация выводит бота из-под действия общих правил User-agent: * в robots.txt, и почему для большинства сайтов разрешение безвредно — сканируются файлы, изначально открытые для программного доступа.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота WellKnownBot: легитимный прочие краулеры и сервисы

Сам оператор WellKnownBot настаивает на терминологической тонкости, которая на практике оказывается важной: по официальному описанию проекта well-known.dev, это не веб-краулер и не spider в привычном понимании, а инструмент (tool) для сканирования узкого класса ресурсов. Разница не формальная — из неё прямо следует, что общие правила User-agent: * в robots.txt на этого бота не действуют, и требуется отдельная, явно прописанная секция именно для его токена.

Что такое well-known ресурсы и зачем их сканировать

Well-known ресурсы — это файлы, которые сайты публикуют по стандартизированным, заранее оговорённым адресам (чаще всего в директории /.well-known/), чтобы сообщать разработчикам, другим сайтам и сервисам определённую информацию о себе — от политики безопасности до параметров интеграции с внешними протоколами. Формат и расположение таких ресурсов обычно фиксируются в технических спецификациях, хотя часть из них сложилась по негласному отраслевому консенсусу, не будучи формально стандартизированной. WellKnownBot выполняет сканирование именно этого узкого набора публичных ресурсов, предназначенных изначально для программного, а не человеческого потребления, — то есть его задача концептуально ближе к валидатору или проверяющему инструменту, чем к поисковому обходчику, который стремится найти и проиндексировать как можно больше страниц сайта.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 (compatible; WellKnownBot/0.1; +https://well-known.dev/about/#bot)
Оператор Well-Known (well-known.dev)
Официальная документация well-known.dev/about — прямо содержит информацию о боте, включая контекст его запросов (в каждом обращении присутствует строка WellKnownBot и ссылка на эту же страницу)
Классификация оператором Официально это не web crawler/spider — согласно первоисточнику, бот запрашивает лишь небольшое число конкретных ресурсов, предназначенных для публичного программного доступа
Область действия правил robots.txt Не следует общим директивам User-agent: * — именно потому, что оператор классифицирует бота как узкоспециализированный инструмент, а не обходной краулер; требуется отдельная явная секция User-agent: WellKnownBot
Область обхода на практике Несколько конкретных публичных well-known URL на сайт — не полный обход контента
Список IP-адресов ❌ Отдельного официального фида не найдено

Почему well-known ресурсы и так публичны — и что это значит для решения о доступе

Ключевая логика, которая должна определять решение: файлы, которые сканирует WellKnownBot, изначально спроектированы как открытые и предназначенные именно для автоматизированного чтения сторонними системами — это не приватные данные и не контент, требующий защиты. Поэтому в подавляющем большинстве случаев разрешение этого бота безвредно: сканируется ровно то, что сайт и так публикует открыто именно с целью, чтобы это прочитали программы, а не люди. Единственный практический сценарий, где имеет смысл сознательный запрет, — если сайт по каким-то причинам не хочет фигурировать конкретно в индексе или базе данных проекта well-known.dev, даже при том что сами файлы остаются публично доступными по прямому запросу.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Сколько трафика он создаёт

По сводке TrafficVeil, паттерн запросов wellknownbot на подключённых доменах составил порядка 10 тысяч за март–июнь 2026 года (июнь — по 14 число). На уровне отдельного сайта это обычно редкие, единичные точечные обращения — что полностью соответствует заявленной оператором модели узкого, а не полного обхода.

Как найти бота в логах

grep -i "WellKnownBot" /var/log/nginx/access.log

Стоит ли блокировать

  • для подавляющего большинства сайтов разрешение безвредно — сканируются исключительно публичные, изначально открытые для программного доступа well-known-файлы;
  • если нежелательно попадание конкретно в индекс или каталог сервиса well-known.dev — уместен точечный запрет именно этого бота, не затрагивающий доступность самих файлов для прямых запросов других систем;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.

Как настроить robots.txt и сервер

Поскольку бот официально не следует общим правилам *, для реального эффекта нужна отдельная явная секция:

User-agent: WellKnownBot
Disallow: /

Явное разрешение — как правило, безопасный вариант по умолчанию, учитывая публичную природу сканируемых ресурсов:

User-agent: WellKnownBot
Allow: /

Для гарантированного результата на уровне сервера, если полный запрет всё же нужен:

if ($http_user_agent ~* "WellKnownBot") {
    return 403;
}

Частые вопросы

WellKnownBot — это поисковый краулер?
Нет, по официальному описанию оператора это узкоспециализированный инструмент, а не веб-краулер или spider — он запрашивает лишь несколько конкретных публичных well-known-файлов, а не обходит весь сайт.
Почему общее правило User-agent: * не останавливает этого бота?
Именно потому что оператор классифицирует его как инструмент, а не краулер — для действия правила нужна отдельная явная секция User-agent: WellKnownBot.
Что такое well-known-ресурсы, которые сканирует бот?
Файлы, публикуемые сайтами по стандартизированным адресам (чаще в /.well-known/) для сообщения информации разработчикам и другим сервисам — изначально предназначены для программного, а не человеческого чтения.
Безопасно ли разрешить этого бота?
Как правило да — сканируются исключительно публичные файлы, изначально открытые именно для автоматизированного доступа сторонними системами.
Когда имеет смысл его заблокировать?
Если сайт не хочет фигурировать конкретно в индексе или каталоге сервиса well-known.dev, даже при том что сами файлы остаются публично доступными.
Повлияет ли блокировка на позиции в поисковых системах?
Нет, этот бот не связан ни с одной поисковой системой.
#wellknownbot#well-known.dev#.well-known#developer helper#бот-энциклопедия#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil