Боты5 мин чтения·11 августа 2026 г.·обновлено 8 сентября 2026 г.

Llmstxtscan: почему этот «AI-краулер» вообще не читает контент вашего сайта

По официальной документации оператора, llmstxtscan не собирает статьи или товары для AI-пайплайна — он лишь проверяет наличие нескольких служебных файлов вроде /llms.txt и /AGENTS.md как часть исследования распространённости новых веб-стандартов. Разбираем, что такое сам стандарт llms.txt, почему риск «утечки контента» здесь неприменим, и почему у бота есть редкий официальный e-mail для быстрого opt-out прямо в строке User-Agent.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота LLMs.txt Crawler: нежелательный бот

Официальная страница оператора прямо переворачивает распространённое представление об этом боте: llmstxtscan не собирает контент сайта для AI-пайплайна — он вообще не читает статьи, товары или блог. Его единственная задача — проверить, опубликовал ли сайт у себя несколько конкретных «служебных» файлов, и если да, зафиксировать этот факт как часть исследования по распространённости новых веб-стандартов. Это принципиально иная категория, чем у типичных AI-краулеров, вычитывающих публичный контент как сырьё для обучения моделей.

Что такое llms.txt и почему появился краулер, который его проверяет

llms.txt — предложенный в сентябре 2024 года австралийским исследователем Джереми Ховардом (Answer.AI) открытый стандарт: markdown-файл в корне сайта (/llms.txt), который в сжатом и структурированном виде описывает содержимое ресурса специально для языковых моделей — по аналогии с тем, как robots.txt регулирует доступ, а sitemap.xml перечисляет страницы для обычных поисковых систем. Стандарт остаётся добровольной инициативой сообщества, а не официальным протоколом, обязательным для соблюдения крупными AI-компаниями — тем не менее формат уже приняли документация Anthropic, Cloudflare и сотни компаний, работающих с разработчиками.

Поскольку стандарт новый и добровольный, естественно возник интерес к тому, насколько широко его вообще принял веб — отсюда и craulер вроде llmstxtscan: он не использует найденные файлы для обучения ИИ, а измеряет саму статистику внедрения подобных «well-known» файлов по публичному вебу в рамках исследования по безопасности и AI-готовности сайтов.

Параметры бота

Параметр Значение
User-Agent llms.txt crawler bot (+https://llmstxtscan.org; opt-out@llmstxtscan.org)
Оператор llmstxtscan.org — открыто раскрывает себя прямо в строке UA, включая контактный e-mail для запроса на исключение
Что именно запрашивает Небольшой набор стандартных файлов: /llms.txt, /llms-full.txt, /AGENTS.md, /.well-known/security.txt, /robots.txt — не обходит остальные страницы сайта
Типичный паттерн запроса Не каждый визит запрашивает весь набор — по заявлению оператора, большинство обращений ограничивается только одним файлом, /llms.txt
Частота обхода Сайт посещается лишь изредка, а запросы намеренно растянуты во времени, чтобы нагрузка оставалась незначительной
Границы доступа По заявлению оператора, бот обращается только к публично доступным ресурсам, не пытается обойти авторизацию, платный доступ или иной контроль доступа, и не выполняет никаких операций записи
Механизм отказа Официальный e-mail для запроса на исключение конкретного домена указан прямо в строке User-Agent — редкий случай, когда механизм opt-out задокументирован без необходимости искать отдельную страницу

Чем это отличается от исходной классификации «нежелательный»

Ярлык «нежелательный» из общей категории AI-краулеров подразумевает риск утечки уникального контента в чужой AI-контур без атрибуции. Для llmstxtscan этот сценарий буквально неприменим: бот запрашивает исключительно служебные файлы фиксированного, известного заранее списка — а не статьи, описания товаров или страницы каталога. Если сайт не публиковал у себя /llms.txt или /AGENTS.md, запрос просто вернёт 404, и никакого содержательного контента бот с этого визита не унесёт вовсе.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Как найти бота в логах

# Базовый поиск
grep -i "llmstxtscan" /var/log/nginx/access.log

# Какие именно служебные файлы запрашивал бот
grep -i "llmstxtscan" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c

Если в выдаче видны только запросы к перечисленным выше служебным путям и ничего больше — это соответствует заявленному поведению оператора; заметный обход обычных страниц сайта под тем же UA стал бы поводом усомниться в подлинности запроса и свериться с ASN IP через whois.

Стоит ли блокировать

Учитывая узкий и прозрачно задокументированный характер запросов, решение здесь особенно низкорисковое в любую сторону:

  • если сайт уже публикует /llms.txt или планирует его внедрить как часть AI-оптимизации контента — присутствие в исследовании распространённости стандарта не несёт практического риска, поскольку бот лишь фиксирует факт наличия файла, а не забирает остальной контент;
  • если нежелательно даже минимальное периодическое обращение к этим путям — можно воспользоваться официальным e-mail для opt-out прямо из строки UA, что избавляет от необходимости настраивать серверные правила вручную;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — это не поисковый краулер ни одной из систем.

Как настроить доступ, если предпочтительна серверная блокировка

Стандартный запрет через robots.txt:

User-agent: llms.txt crawler bot
Disallow: /
if ($http_user_agent ~* "llmstxtscan") {
    return 403;
}

Но, учитывая официально указанный контактный адрес для запроса на исключение, для большинства сайтов проще и надёжнее один раз написать на opt-out@llmstxtscan.org с указанием домена, чем поддерживать отдельное серверное правило ради бота, чья нагрузка и без того намеренно сведена оператором к минимуму.

Частые вопросы

Собирает ли llmstxtscan контент сайта для обучения AI-моделей?
Нет, по официальной документации оператора бот запрашивает только несколько служебных файлов фиксированного списка, а не статьи, товары или страницы каталога.
Что такое llms.txt, наличие которого проверяет бот?
Предложенный в 2024 году открытый markdown-стандарт для корня сайта, который в структурированном виде описывает контент специально для языковых моделей — по аналогии с robots.txt и sitemap.xml.
Что произойдёт, если на сайте нет файла /llms.txt?
Запрос бота просто вернёт 404 — никакого содержательного контента с этого визита бот не унесёт.
Как часто бот посещает сайт?
Редко, а запросы намеренно растянуты во времени — по заявлению оператора, нагрузка держится намеренно незначительной.
Как отказаться от визитов этого бота, не настраивая сервер?
Написать на официальный e-mail opt-out@llmstxtscan.org с указанием домена — адрес указан прямо в строке User-Agent бота.
Повлияет ли присутствие или блокировка бота на позиции в поисковых системах?
Нет, это не поисковый краулер ни одной из систем — исследовательский бот, изучающий распространённость нового стандарта.
#llmstxtscan#llms.txt#AGENTS.md#AI-краулер#бот-энциклопедия#robots.txt#opt-out#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil