Сам оператор WellKnownBot настаивает на терминологической тонкости, которая на практике оказывается важной: по официальному описанию проекта well-known.dev, это не веб-краулер и не spider в привычном понимании, а инструмент (tool) для сканирования узкого класса ресурсов. Разница не формальная — из неё прямо следует, что общие правила User-agent: * в robots.txt на этого бота не действуют, и требуется отдельная, явно прописанная секция именно для его токена.
Что такое well-known ресурсы и зачем их сканировать
Well-known ресурсы — это файлы, которые сайты публикуют по стандартизированным, заранее оговорённым адресам (чаще всего в директории /.well-known/), чтобы сообщать разработчикам, другим сайтам и сервисам определённую информацию о себе — от политики безопасности до параметров интеграции с внешними протоколами. Формат и расположение таких ресурсов обычно фиксируются в технических спецификациях, хотя часть из них сложилась по негласному отраслевому консенсусу, не будучи формально стандартизированной. WellKnownBot выполняет сканирование именно этого узкого набора публичных ресурсов, предназначенных изначально для программного, а не человеческого потребления, — то есть его задача концептуально ближе к валидатору или проверяющему инструменту, чем к поисковому обходчику, который стремится найти и проиндексировать как можно больше страниц сайта.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; WellKnownBot/0.1; +https://well-known.dev/about/#bot) |
| Оператор | Well-Known (well-known.dev) |
| Официальная документация | well-known.dev/about — прямо содержит информацию о боте, включая контекст его запросов (в каждом обращении присутствует строка WellKnownBot и ссылка на эту же страницу) |
| Классификация оператором | Официально это не web crawler/spider — согласно первоисточнику, бот запрашивает лишь небольшое число конкретных ресурсов, предназначенных для публичного программного доступа |
| Область действия правил robots.txt | Не следует общим директивам User-agent: * — именно потому, что оператор классифицирует бота как узкоспециализированный инструмент, а не обходной краулер; требуется отдельная явная секция User-agent: WellKnownBot |
| Область обхода на практике | Несколько конкретных публичных well-known URL на сайт — не полный обход контента |
| Список IP-адресов | ❌ Отдельного официального фида не найдено |
Почему well-known ресурсы и так публичны — и что это значит для решения о доступе
Ключевая логика, которая должна определять решение: файлы, которые сканирует WellKnownBot, изначально спроектированы как открытые и предназначенные именно для автоматизированного чтения сторонними системами — это не приватные данные и не контент, требующий защиты. Поэтому в подавляющем большинстве случаев разрешение этого бота безвредно: сканируется ровно то, что сайт и так публикует открыто именно с целью, чтобы это прочитали программы, а не люди. Единственный практический сценарий, где имеет смысл сознательный запрет, — если сайт по каким-то причинам не хочет фигурировать конкретно в индексе или базе данных проекта well-known.dev, даже при том что сами файлы остаются публично доступными по прямому запросу.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Сколько трафика он создаёт
По сводке TrafficVeil, паттерн запросов wellknownbot на подключённых доменах составил порядка 10 тысяч за март–июнь 2026 года (июнь — по 14 число). На уровне отдельного сайта это обычно редкие, единичные точечные обращения — что полностью соответствует заявленной оператором модели узкого, а не полного обхода.
Как найти бота в логах
grep -i "WellKnownBot" /var/log/nginx/access.log
Стоит ли блокировать
- для подавляющего большинства сайтов разрешение безвредно — сканируются исключительно публичные, изначально открытые для программного доступа well-known-файлы;
- если нежелательно попадание конкретно в индекс или каталог сервиса well-known.dev — уместен точечный запрет именно этого бота, не затрагивающий доступность самих файлов для прямых запросов других систем;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет.
Как настроить robots.txt и сервер
Поскольку бот официально не следует общим правилам *, для реального эффекта нужна отдельная явная секция:
User-agent: WellKnownBot
Disallow: /
Явное разрешение — как правило, безопасный вариант по умолчанию, учитывая публичную природу сканируемых ресурсов:
User-agent: WellKnownBot
Allow: /
Для гарантированного результата на уровне сервера, если полный запрет всё же нужен:
if ($http_user_agent ~* "WellKnownBot") {
return 403;
}Частые вопросы
WellKnownBot — это поисковый краулер?
Почему общее правило User-agent: * не останавливает этого бота?
Что такое well-known-ресурсы, которые сканирует бот?
Безопасно ли разрешить этого бота?
Когда имеет смысл его заблокировать?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.