Боты5 мин чтения·12 августа 2026 г.

Perplexity-User: официально не для обучения моделей — и официально может игнорировать robots.txt

Вопреки шаблонному описанию как «краулера для обучающих датасетов», Perplexity официально заявляет: компания не строит базовые модели, и Perplexity-User — не PerplexityBot, а совсем другой агент, срабатывающий в реальном времени по запросу живого пользователя. Разбираем ключевое официальное признание компании — этот агент, как правило, не соблюдает robots.txt, — и почему для чувствительных разделов сайта нужен настоящий контроль доступа, а не файл политики.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Perplexity User: нежелательный ai и llm-краулеры

Ключевая ошибка в описании Perplexity-User как «обучающего краулера для датасетов языковых моделей» — Perplexity официально и прямо заявляет обратное: компания не строит собственные базовые модели, и содержимое сайтов не используется для их предобучения. У Perplexity-User совершенно другая, официально задокументированная функция — и она не имеет отношения ни к обучению, ни к фоновой индексации.

Perplexity-User — не то же самое, что PerplexityBot

Perplexity официально разделяет двух разных агентов с разными задачами. PerplexityBot — фоновый поисковый краулер, который строит и обновляет индекс, лежащий в основе ответов сервиса; он соблюдает robots.txt, и блокировка этого бота ограничивает именно использование контента в предобучении и фоновой индексации. Perplexity-User — принципиально другой агент: он срабатывает не по расписанию, а в реальном времени, когда конкретный живой пользователь задаёт AI-ассистенту Perplexity вопрос, требующий свежих данных с конкретной страницы. По официальной документации компании, собранные этим агентом данные не используются для прямого цитирования содержимого страницы «как есть» — они формируют генеративный ответ, то есть попадают в категорию «входных данных» для формирования ответа, а не готового обучающего материала.

Важный нюанс про robots.txt — именно здесь, а не у PerplexityBot

Показательная деталь, которую часто упускают: по документации самой Perplexity, Perplexity-User в общем случае не следует robots.txt — потому что запрос инициирован живым человеком в моменте, а не автономным фоновым обходом, и логически приравнивается к тому, как если бы сам пользователь открыл страницу в браузере. Это официально признанная особенность, а не единичный случай нарушения правил. Ранее у Perplexity была отдельная функция, которая позволяла пользователю попросить ассистента резюмировать содержимое конкретного URL, даже если сайт был закрыт через robots.txt, — фактически имитируя ситуацию, будто человек скопировал текст сам. Компания отключила эту функцию именно из-за риска злоупотреблений, и сегодня PerplexityBot строго соблюдает правила при построении индекса — но это уточнение касается именно PerplexityBot, а не Perplexity-User, у которого особый статус в отношении robots.txt сохраняется официально.

Параметры бота

Параметр Значение
User-Agent Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user)
Оператор Perplexity AI
Триггер запроса Живой пользователь Perplexity задаёт вопрос, требующий актуальных данных с конкретной страницы — не фоновое расписание
Использование данных Формирование генеративного ответа с цитированием источника — не прямое обучение базовых моделей, что Perplexity подтверждает официально
Соблюдение robots.txt Официально — как правило, нет; трактуется компанией как аналог живого запроса пользователя, а не автономного краулера
Верификация Идентификация через домен perplexity.ai в UA + обратный DNS-запрос для подтверждения подлинности
Родственный, но другой бот PerplexityBot — фоновый индексирующий краулер, официально соблюдающий robots.txt, с отдельно публикуемым списком IP
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Практическое следствие: почему шаблонное правило в robots.txt здесь работает слабее

Раз Perplexity-User официально не гарантированно соблюдает robots.txt, полагаться на файл политики как единственный механизм контроля для этого конкретного агента не стоит — это тот же случай, что уже разбирался для ChatGPT Operator из этой серии: трафик по своей природе ближе к автоматизированному браузеру живого человека, чем к фоновому индексатору, с которым можно «договориться» через стандартный протокол. Для действительно чувствительных разделов сайта (личный кабинет, оформление заказа, платёжные формы) надёжнее полагаться не на robots.txt, а на настоящий контроль доступа — авторизацию, WAF-правила по User-Agent и IP.

Стоит ли блокировать

  • если сайт заинтересован в том, чтобы его контент цитировался в ответах Perplexity в реальном времени по актуальным пользовательским запросам, — Perplexity-User стоит оставить разрешённым, поскольку именно он отвечает за появление сайта как источника в свежих, актуальных ответах;
  • если цель — не допустить использования контента в обучении будущих моделей — для этого нужно управлять PerplexityBot, а не Perplexity-User, поскольку сама компания подтверждает, что не строит базовые модели на основе этих данных вообще;
  • для действительно чувствительных данных — не полагаться на robots.txt в принципе, а защищать их авторизацией или сетевыми правилами;
  • на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этих ботов не влияет — это отдельная экосистема.

Как найти бота в логах

grep -i "perplexity-user" /var/log/nginx/access.log

# Отделить от фонового индексирующего краулера
grep -iE "perplexity-user|perplexitybot" /var/log/nginx/access.log | \
  sed -n 's/.*"\([^"]*\)".*/\1/p' | sort | uniq -c | sort -rn

Для верификации — обратный DNS-запрос по IP, который должен приводить к домену perplexity.ai:

IP="1.2.3.4"
dig +short -x "$IP"

Как настроить robots.txt

Отдельные, независимо настраиваемые секции для двух ботов — рабочая схема для большинства сайтов:

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

Полный запрет для обоих, если присутствие в экосистеме Perplexity в целом нежелательно:

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /
if ($http_user_agent ~* "perplexity-user") {
    return 403;
}

Учитывая официально признанную особенность несоблюдения robots.txt агентом Perplexity-User, для чувствительных разделов это правило стоит дублировать через блокировку на уровне сервера, а не полагаться исключительно на файл политики.

Частые вопросы

Perplexity-User собирает данные для обучения AI-моделей?
Нет, Perplexity официально заявляет, что не строит собственные базовые модели — контент используется только для формирования генеративного ответа в моменте.
Чем Perplexity-User отличается от PerplexityBot?
PerplexityBot — фоновый индексирующий краулер, соблюдающий robots.txt; Perplexity-User срабатывает в реальном времени по запросу живого пользователя и, как правило, robots.txt не соблюдает.
Правда ли, что Perplexity-User может игнорировать robots.txt?
Да, это официально признанная компанией особенность — запрос трактуется как аналог живого пользователя, открывающего страницу в браузере, а не автономного краулера.
Была ли раньше более рискованная функция, связанная с этим?
Да, пользователи могли попросить ассистента резюмировать заблокированный через robots.txt URL — компания отключила эту функцию из-за риска злоупотреблений.
Как защитить действительно чувствительные разделы сайта от этого агента?
Не полагаться на robots.txt, а использовать настоящий контроль доступа — авторизацию, WAF-правила по User-Agent и IP.
Как проверить подлинность запроса от Perplexity-User?
Через обратный DNS-запрос по IP, который должен приводить к домену perplexity.ai.
#perplexity-user#perplexitybot#Perplexity AI#AI-краулер#бот-энциклопедия#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil