Ключевая ошибка в описании Perplexity-User как «обучающего краулера для датасетов языковых моделей» — Perplexity официально и прямо заявляет обратное: компания не строит собственные базовые модели, и содержимое сайтов не используется для их предобучения. У Perplexity-User совершенно другая, официально задокументированная функция — и она не имеет отношения ни к обучению, ни к фоновой индексации.
Perplexity-User — не то же самое, что PerplexityBot
Perplexity официально разделяет двух разных агентов с разными задачами. PerplexityBot — фоновый поисковый краулер, который строит и обновляет индекс, лежащий в основе ответов сервиса; он соблюдает robots.txt, и блокировка этого бота ограничивает именно использование контента в предобучении и фоновой индексации. Perplexity-User — принципиально другой агент: он срабатывает не по расписанию, а в реальном времени, когда конкретный живой пользователь задаёт AI-ассистенту Perplexity вопрос, требующий свежих данных с конкретной страницы. По официальной документации компании, собранные этим агентом данные не используются для прямого цитирования содержимого страницы «как есть» — они формируют генеративный ответ, то есть попадают в категорию «входных данных» для формирования ответа, а не готового обучающего материала.
Важный нюанс про robots.txt — именно здесь, а не у PerplexityBot
Показательная деталь, которую часто упускают: по документации самой Perplexity, Perplexity-User в общем случае не следует robots.txt — потому что запрос инициирован живым человеком в моменте, а не автономным фоновым обходом, и логически приравнивается к тому, как если бы сам пользователь открыл страницу в браузере. Это официально признанная особенность, а не единичный случай нарушения правил. Ранее у Perplexity была отдельная функция, которая позволяла пользователю попросить ассистента резюмировать содержимое конкретного URL, даже если сайт был закрыт через robots.txt, — фактически имитируя ситуацию, будто человек скопировал текст сам. Компания отключила эту функцию именно из-за риска злоупотреблений, и сегодня PerplexityBot строго соблюдает правила при построении индекса — но это уточнение касается именно PerplexityBot, а не Perplexity-User, у которого особый статус в отношении robots.txt сохраняется официально.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) |
| Оператор | Perplexity AI |
| Триггер запроса | Живой пользователь Perplexity задаёт вопрос, требующий актуальных данных с конкретной страницы — не фоновое расписание |
| Использование данных | Формирование генеративного ответа с цитированием источника — не прямое обучение базовых моделей, что Perplexity подтверждает официально |
| Соблюдение robots.txt | Официально — как правило, нет; трактуется компанией как аналог живого запроса пользователя, а не автономного краулера |
| Верификация | Идентификация через домен perplexity.ai в UA + обратный DNS-запрос для подтверждения подлинности |
| Родственный, но другой бот | PerplexityBot — фоновый индексирующий краулер, официально соблюдающий robots.txt, с отдельно публикуемым списком IP |
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Практическое следствие: почему шаблонное правило в robots.txt здесь работает слабее
Раз Perplexity-User официально не гарантированно соблюдает robots.txt, полагаться на файл политики как единственный механизм контроля для этого конкретного агента не стоит — это тот же случай, что уже разбирался для ChatGPT Operator из этой серии: трафик по своей природе ближе к автоматизированному браузеру живого человека, чем к фоновому индексатору, с которым можно «договориться» через стандартный протокол. Для действительно чувствительных разделов сайта (личный кабинет, оформление заказа, платёжные формы) надёжнее полагаться не на robots.txt, а на настоящий контроль доступа — авторизацию, WAF-правила по User-Agent и IP.
Стоит ли блокировать
- если сайт заинтересован в том, чтобы его контент цитировался в ответах Perplexity в реальном времени по актуальным пользовательским запросам, — Perplexity-User стоит оставить разрешённым, поскольку именно он отвечает за появление сайта как источника в свежих, актуальных ответах;
- если цель — не допустить использования контента в обучении будущих моделей — для этого нужно управлять PerplexityBot, а не Perplexity-User, поскольку сама компания подтверждает, что не строит базовые модели на основе этих данных вообще;
- для действительно чувствительных данных — не полагаться на robots.txt в принципе, а защищать их авторизацией или сетевыми правилами;
- на позиции в органической выдаче Google, Bing или Яндекса присутствие или отсутствие этих ботов не влияет — это отдельная экосистема.
Как найти бота в логах
grep -i "perplexity-user" /var/log/nginx/access.log
# Отделить от фонового индексирующего краулера
grep -iE "perplexity-user|perplexitybot" /var/log/nginx/access.log | \
sed -n 's/.*"\([^"]*\)".*/\1/p' | sort | uniq -c | sort -rn
Для верификации — обратный DNS-запрос по IP, который должен приводить к домену perplexity.ai:
IP="1.2.3.4"
dig +short -x "$IP"
Как настроить robots.txt
Отдельные, независимо настраиваемые секции для двух ботов — рабочая схема для большинства сайтов:
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
Полный запрет для обоих, если присутствие в экосистеме Perplexity в целом нежелательно:
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
if ($http_user_agent ~* "perplexity-user") {
return 403;
}
Учитывая официально признанную особенность несоблюдения robots.txt агентом Perplexity-User, для чувствительных разделов это правило стоит дублировать через блокировку на уровне сервера, а не полагаться исключительно на файл политики.
Частые вопросы
Perplexity-User собирает данные для обучения AI-моделей?
Чем Perplexity-User отличается от PerplexityBot?
Правда ли, что Perplexity-User может игнорировать robots.txt?
Была ли раньше более рискованная функция, связанная с этим?
Как защитить действительно чувствительные разделы сайта от этого агента?
Как проверить подлинность запроса от Perplexity-User?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.