PerplexityBot — индексация для поиска и цитирований в Perplexity (по официальной позиции — не обучение foundation-моделей). Оператор: Perplexity. Ниже — факты из публичной документации и практики верификации: полный UA, IP/ASN, robots.txt, с кем не путать и как настроить правила так, чтобы не отрезать соседний полезный агент. Краулер Perplexity AI индексирует страницы для поисковой системы Perplexity с цитированием источников — загружает контент, чтобы формировать ответы со ссылками на первоисточники.
Что такое PerplexityBot
| Параметр | Значение |
|---|---|
| User-Agent (токен) | perplexitybot |
| Полная / типовая строка UA | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) |
| Оператор | Perplexity |
| Назначение | Индексация для поиска/цитирований в Perplexity — по официальной позиции, не обучение foundation-моделей |
| Официальная документация | docs.perplexity.ai/docs/resources/perplexity-crawlers |
| IP / верификация | ✅ Официальный feed: perplexity.com/perplexitybot.json — отдельно для PerplexityBot и для Perplexity-User (perplexity-user.json). Обновлять регулярно, встречаются IP вне опубликованных диапазонов |
| ASN (ориентир) | не зафиксирован публично |
| Соблюдение robots.txt | Заявлено официально, но не принимайте это как абсолютную гарантию — см. отдельный раздел ниже. Crawl-delay через robots.txt не поддерживается |
| Категория TrafficVeil | AI и LLM-краулеры |
Почему заявлению о соблюдении robots.txt не стоит доверять безоговорочно
Официальная документация Perplexity утверждает, что PerplexityBot соблюдает директивы robots.txt. Но есть задокументированный и позже независимо подтверждённый случай, который прямо этому противоречит: исследователь заблокировал сайт через robots.txt, затем задал Perplexity вопрос по конкретной странице этого сайта — и в логах обнаружил, что запрос пришёл вовсе не под именем PerplexityBot, а замаскированным под обычный браузер Chrome. То есть краулер не «нарушил» правило под своим именем — он представился кем-то другим, чтобы правило к нему формально не применялось. Практический вывод: относитесь к заявлению о compliance как к официальной позиции, а не как к гарантии. Дублируйте контроль на уровне сервера (rate-limit/WAF), особенно для чувствительного контента, а не полагайтесь только на строку в robots.txt.
Что на самом деле останавливает Disallow
Даже при полном запрете через robots.txt сайт не исчезает из Perplexity целиком: домен, заголовок страницы и краткое факт-резюме могут по-прежнему появляться в ответах. Disallow останавливает только полнотекстовую индексацию контента, а не любое упоминание домена. Если цель — полностью убрать сайт из поля зрения Perplexity, одного robots.txt может быть недостаточно.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как работает и зачем приходит
Нужны цитирования в Perplexity — разрешайте PerplexityBot и добавляйте IP allowlist из официального JSON. Не хотите индекс — ставьте Disallow для PerplexityBot, но учитывайте, что Perplexity-User (агент, который подгружает страницу по прямому запросу живого пользователя) может всё равно зайти — это user-initiated fetch, и официально он в общем случае игнорирует robots.txt.
Нагрузка на сервер
По сводке TrafficVeil (bots-summary, март–июнь 2026, июнь по 14.06) perplexitybot: 37 526 запросов суммарно (март 6 886, апрель 12 071, май 14 118, июнь 4 451). Перед жёсткими правилами сверьте июль–август в аналитике TrafficVeil. Смотрите не только RPS, но и path-паттерн: плотный обход каталога без сессий — повод для rate-limit/deny; точечные хиты под user-fetch — другая политика.
Обнаружение в логах и IP
grep -i "perplexitybot" /var/log/nginx/access.log
grep -i "perplexitybot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
grep -i "perplexitybot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
# Актуальные IP (официальный JSON)
curl -s "https://www.perplexity.com/perplexitybot.json" | head
Важно: официальные JSON с IP публикуются отдельно для PerplexityBot и для Perplexity-User — обновляйте по расписанию, поскольку диапазоны меняются, а отдельные IP порой оказываются вне опубликованных списков. Учитывая известный случай маскировки под обычный браузер, связка UA + IP/ASN/официальный JSON важна не «для надёжности», а по существу — одной строки UA недостаточно.
robots.txt
User-agent: perplexitybot
Disallow: /
User-agent: perplexitybot
Allow: /
User-agent: perplexitybot
Disallow: /admin/
Disallow: /cart/
Allow: /
PerplexityBot формально уважает robots.txt, но подтверждённый случай маскировки под браузер показывает, что доверять этому как единственному барьеру рискованно. Perplexity-User — user-initiated fetch и официально в общем случае игнорирует robots.txt. Если в семействе есть «полезный» и «нежелательный» агент — делайте отдельные User-agent блоки и не режьте обоих одним ASN-баном.
Nginx / Apache / TrafficVeil
Nginx
if ($http_user_agent ~* "perplexitybot") {
return 403;
}
Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} perplexitybot [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите perplexitybot в ботах домена или /system/bots
- Нужны цитирования в Perplexity — Allow PerplexityBot + IP allowlist из JSON
- Не хотите индекс — Disallow PerplexityBot; учтите, что Perplexity-User может всё равно ходить, и что домен/заголовок/краткое резюме могут остаться видимыми даже при полном запрете
- После изменения сверьте логи за 15–60 минут
Рекомендации
- Нужны цитирования — Allow PerplexityBot + IP allowlist из JSON; не хотите индекс — Disallow, помня об ограничениях этого запрета
- Не полагайтесь только на robots.txt — заявленный compliance PerplexityBot не абсолютен, известен зафиксированный случай маскировки под обычный браузер
- Не баньте весь потенциальный диапазон оператора, если в семье есть нужный сайту бот
- Обновляйте IP JSON по cron — диапазоны меняются, и отдельные запросы выходят за опубликованные пределы
- Crawl-delay через robots.txt не поддерживается — для троттлинга используйте rate-limit на своей стороне
- Сверяйте свежую статистику TrafficVeil, не только сводку март–июнь 2026
С кем не путать
| Бот | Роль | Комментарий |
|---|---|---|
| Perplexity-User | Загрузка URL по запросу живого пользователя; IP: perplexity-user.json; robots.txt обычно не стоп-кран | семья Perplexity |
Стратегия
| Цель | Действие |
|---|---|
| Нужна польза от оператора | Allow + точечные Disallow служебных путей |
| Бот только грузит сервер / забирает данные | Disallow + deny в TrafficVeil / nginx |
| Есть официальный IP JSON | UA + IP verification / WAF IP set — обязательно, а не опционально |
| Чувствительный контент, важна гарантия исключения | Не полагайтесь на один robots.txt — добавьте серверную блокировку |
Частые вопросы
Точно ли PerplexityBot соблюдает robots.txt, как заявляет Perplexity?
Исчезнет ли сайт из Perplexity полностью после Disallow для PerplexityBot?
В чём разница между PerplexityBot и Perplexity-User?
Можно ли замедлить PerplexityBot через Crawl-delay в robots.txt?
Достаточно ли блокировки только по строке User-Agent?
Что делать, если для сайта критично гарантированно исключить контент из Perplexity?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.